Artykuł Technologie

Ollama Models - ranking najlepszych modeli do Ollama (Local i Cloud)

Ranking w skrócie i jak go czytać

Ten ranking Ollama Models porządkuje bibliotekę modeli pod kątem tego, co realnie uruchomisz - do czatu, kodowania, RAG i agentów. Najlepszy model do Ollama zależy od dwóch decyzji: czy pracujesz lokalnie, czy w Ollama Cloud, i ile masz pamięci. Lokalnie do 8 GB celuj w gemma4:e2b lub qwen3.5:4b, do 16 GB w gpt-oss:20b, przy 24 GB VRAM w gemma4:31b lub qwen3.6. Flagowce agentic (GLM-5.x, Kimi, MiniMax M3, DeepSeek V4) chodzą tylko w Cloud. Do polskiego - Bielik.

Konkret: nie ma jednego "najlepszego" modelu. Jest najlepszy model do Twojego zadania, Twojej pamięci i Twojego modelu pracy (lokalnie vs chmura Ollamy). Poniższa tabela to skrót decyzyjny - od niej zacznij, a szczegóły znajdziesz w sekcjach niżej. Snapshot listy modeli pochodzi z biblioteki Ollama z lipca 2026 roku; landscape zmienia się co tydzień, więc traktuj konkretne wersje jako datowane, a strukturę wyboru jako stałą.

Sprzęt / tryb Rekomendacja Rozmiar pliku Najlepsze do
do 8 GB RAM (bez GPU) gemma4:e2b / qwen3.5:4b 3,4-7,2 GB szybki czat, edge, CPU-only
16 GB RAM / 8 GB VRAM gpt-oss:20b / qwen3.5:9b 6,6-14 GB ogólny asystent, tool-calling, reasoning
24 GB VRAM (RTX 3090/4090) gemma4:31b / qwen3.6:27b 17-20 GB jakość lokalnie, agenci
serwer 48-128 GB gpt-oss:120b / qwen3.5:122b 65-81 GB najwyższa jakość lokalnie
Ollama Cloud GLM-5.x / Kimi / DeepSeek V4 / MiniMax M3 brak (chmura) flagowce, których nie uruchomisz w domu
język polski Bielik 11B / 4.5B / 1.5B wg wariantu treści po polsku

W praktyce: rozmiar pliku modelu to najważniejsza liczba przy pracy lokalnej, bo to on musi zmieścić się w Twojej pamięci. Do tego dolicz 1-2 GB na okno kontekstu. Przy Cloud liczy się co innego - plan i limity czasu GPU. Resztę wyjaśniam sekcja po sekcji.

Jak czytać ten ranking

Porządkuję tu modele według praktycznego kryterium: co realnie uruchomisz - i gdzie. To przewodnik po oprogramowaniu, a nie recenzja jednego produktu, dlatego nie dostajesz pojedynczej oceny od 1 do 10. Modele lokalne są darmowe i open-weight, więc zamiast ratingu dostajesz rekomendacje per profil sprzętowy i per zadanie. Przy modelach Cloud dochodzi wymiar planu i limitów.

Rozmiary plików podaję z realnych wariantów widocznych na kartach modeli w bibliotece Ollama - to twarde liczby, na których stoi cały dobór sprzętu. Kryteria, które porównuję: jakość względem rozmiaru, wymagania pamięci, obsługa języka polskiego i licencja. Do jakości samych modeli odwołuję się jakościowo, na podstawie tego, co potwierdzają publiczne karty modeli - bez zmyślonych benchmarków punktowych.

Ollama Cloud vs Local - najważniejsza decyzja

To zmiana, której stare rankingi Ollamy nie uwzględniają. Dziś część modeli ma tag cloud i nie chodzi na Twoim sprzęcie - jest przenoszona na serwery Ollamy. Zanim wybierzesz model, ustal, w którym trybie pracujesz.

Czym jest Ollama Cloud

Ollama Cloud to typ modeli, które nie wymagają mocnego GPU lokalnie - są automatycznie offloadowane na infrastrukturę chmurową Ollamy, ale z poziomu tych samych narzędzi co modele lokalne (CLI ollama run, API na localhost:11434, SDK Python i JavaScript). Idea jest prosta: używasz lokalnego workflow, a pod spodem chodzi duży model, który nie zmieściłby się na Twoim komputerze. Cloud da się w każdej chwili wyłączyć i pracować w pełni lokalnie.

Jak się połączyć

Zaloguj się komendą ollama signin (konto na ollama.com), a potem uruchom model cloud, dodając do tagu -cloud, na przykład ollama run gpt-oss:120b-cloud, ollama run gemma4:31b-cloud czy ollama run qwen3.5:397b-cloud. Dostęp masz też przez oficjalne SDK i przez API na ollama.com z kluczem API. Pełną listę modeli cloud daje filtr ollama.com/search?c=cloud.

Cennik i limity

Rozliczenie Cloud nie jest per token ani per request - liczone jest realne wykorzystanie GPU (czas GPU zależny od wielkości modelu i długości requestu; cache kontekstu zmniejsza zużycie). Uruchamianie modeli na własnym sprzęcie jest zawsze bez limitu; limity dotyczą wyłącznie chmury. Plany według cennika Ollamy z lipca 2026 roku:

Plan Cena Co daje
Free 0 $ Modele lokalne bez limitu + dostęp do cloud w lekkim użyciu; 1 model cloud równocześnie
Pro 20 $/mies (lub 200 $/rok) Większe modele cloud; 3 modele cloud równocześnie; 50x więcej zużycia cloud niż Free; upload prywatnych modeli
Max 100 $/mies 10 modeli cloud równocześnie; 5x więcej zużycia niż Pro
Team wkrótce Współdzielony limit, SSO, centralne rozliczenia, kontrola dostępu, MDM

Limity sesyjne resetują się co 5 godzin, a tygodniowe co 7 dni. Każdy model ma na swojej stronie poziom "ciężkości" w skali od 1 do 4 - od lekkiego (jak gpt-oss:20b) po bardzo ciężki (jak deepseek-v4-pro). Nadmiar requestów jest kolejkowany, a gdy kolejka się zapełni - odrzucany. Plany Pro i Max mogą dokupić dodatkowy balans zużycia; najpierw zużywa się limit planu, potem doładowanie. Przy 90 procentach limitu dostaniesz e-mail (można to wyłączyć).

Prywatność

Hosting to głównie Stany Zjednoczone, a przy szczytach ruchu routing trafia też do Europy i Singapuru. Ollama deklaruje, że prompty i odpowiedzi nie są logowane ani używane do treningu, a partnerzy infrastrukturalni (NVIDIA Cloud Providers) działają z wymogiem zero logowania, zero treningu i zero retencji danych. W chmurze modele chodzą na natywnych wagach producenta (na nowym sprzęcie NVIDIA w formatach typu NVFP4), więc jakość nie jest cięta kwantyzacją tak jak przy pobieraniu lokalnym.

Kiedy Cloud, a kiedy Local

Wybierz Cloud, gdy chcesz uruchomić model, który nie zmieści się w Twoim RAM/VRAM (od 120B po biliony parametrów), nie chcesz kupować GPU i potrzebujesz najnowszych flagowców agentic-coding (GLM-5.x, Kimi K2.7, DeepSeek V4, MiniMax M3), a wysyłanie danych do chmury Ollamy Ci nie przeszkadza i akceptujesz płatny plan.

Wybierz Local, gdy zależy Ci na pełnej prywatności (dane nie opuszczają maszyny), pracy offline i braku abonamentu, a model mieści się w Twojej pamięci. Jest też droga pośrednia: część modeli - gemma4, qwen3.5, gpt-oss, qwen3-coder, nemotron-3-nano, deepseek-v3.1, devstral-2 - ma oba warianty. Trzymasz wtedy mały model lokalnie na co dzień, a po duży -cloud sięgasz z tego samego CLI, gdy trzeba więcej mocy.

Jeśli chcesz prywatności chmury bez płacenia Ollamie za czas GPU, alternatywą jest własny serwer GPU albo VPS pod LLM - płacisz za czas pracy maszyny i sam kontrolujesz dane.

Co decyduje o wyborze modelu lokalnego

Zanim wybierzesz model do pobrania, warto rozumieć cztery pojęcia, bo to one przesądzają, czy model w ogóle ruszy na Twoim sprzęcie.

Parametry i kwantyzacja. Liczba parametrów (np. 8B = 8 miliardów) mówi o pojemności modelu. Kwantyzacja to kompresja wag - domyślny Q4 to rozsądny kompromis jakości i rozmiaru. Pułapka: przy małych modelach kwantyzacja mocno szkodzi jakości, więc dla nich i dla function-callingu wybieraj wyższą kwantyzację (Q6 lub Q8) zamiast domyślnego Q4. Nowe rodziny dokładają własne formaty - gpt-oss używa natywnie MXFP4, a dla Apple Silicon dostępne są warianty MLX (Gemma 4, Qwen 3.5/3.6).

Rozmiar pliku a pamięć. To najważniejszy filtr. Reguła kciuka: potrzebujesz RAM/VRAM co najmniej równego rozmiarowi pliku modelu plus 1-2 GB na kontekst. Realne rozmiary plików z kart modeli (stan z lipca 2026 roku):

Model (tag) Rozmiar pliku
qwen3.5:0.8b 1,0 GB
qwen3.5:2b 2,7 GB
qwen3.5:4b 3,4 GB
qwen3.5:9b 6,6 GB
gemma4:e2b 7,2 GB
gemma4:12b 7,6 GB
gemma4:e4b 9,6 GB
lfm2:24b (MoE 2B active) 14 GB
gpt-oss:20b 14 GB
qwen3.5:27b 17 GB
qwen3.6:27b 17 GB
gemma4:26b (MoE A4B) 18 GB
gemma4:31b 20 GB
qwen3.5:35b 24 GB
qwen3.6:35b 24 GB
gpt-oss:120b 65 GB
qwen3.5:122b 81 GB

Context window. To ile tekstu model pamięta naraz. Nowe frontiery agentic potrafią obsłużyć ogromne okna - MiniMax M3 i DeepSeek V4-Flash deklarują na kartach kontekst rzędu miliona tokenów. Do agentów i kodu realnie potrzeba dużego okna, bo sam prompt systemowy agenta potrafi zająć ponad 9 tysięcy tokenów, a większy kontekst to więcej zajętej pamięci.

Rodzina i wariant. Tag modelu to nazwa rodziny plus rozmiar i wariant, np. gemma4:12b. Warianty "instruct" są dostrojone do rozmów i poleceń, "base" to model surowy. Osobno są warianty vision (obraz), audio, coder oraz thinking (reasoning). Główne rodziny w bibliotece Ollama w 2026 roku: Gemma (Google), Qwen (Alibaba), gpt-oss (OpenAI), Granite (IBM), LFM2 (Liquid AI), Nemotron (NVIDIA), Mistral, GLM (Z.ai), Kimi (Moonshot), MiniMax i DeepSeek. Poprzednia generacja - Llama 3.x, Qwen3, Gemma 3, DeepSeek-R1 - nadal działa i bywa popularna, ale przestała być stanem sztuki.

Licencja. Modele lokalne z tego rankingu są open-weight, czyli pobierzesz je i uruchomisz za darmo (gpt-oss ma wprost licencję Apache 2.0). Warunki różnią się jednak per rodzina - część rodzin ma ograniczenia komercyjne albo wymogi atrybucji. Konkret: jeśli używasz modelu firmowo, przejrzyj licencję na karcie modelu, zanim wdrożysz go produkcyjnie. To jedyny "ukryty" koszt przy modelach lokalnych, bo za same wagi nie płacisz.

Ranking modeli ogólnego przeznaczenia (Local)

To modele do czatu, asystenta i codziennych zadań, które pobierzesz na własny sprzęt. Konkret: dla większości osób z typowym desktopem najlepszym punktem startu jest gpt-oss:20b (jeśli masz 16 GB RAM) albo któryś ze średnich wariantów Qwen 3.5 i Gemma 4. Przy każdej rodzinie podaję realny rozmiar pliku, sprzęt i komendę pobrania.

Gemma 4

Flagowy multimodal Google DeepMind - obsługuje tekst, obraz i audio, ma tryb thinking i tool-calling. Warianty edge E2B (7,2 GB) i E4B (9,6 GB) celują w laptopy, gemma4:12b (7,6 GB) w desktop, a gemma4:26b (MoE, 18 GB) i gemma4:31b (20 GB) w stacje z 24 GB VRAM. Zastępuje Gemma 3, jest wielojęzyczna, więc po polsku radzi sobie zauważalnie lepiej niż stare Llamy. ollama pull gemma4:12b. Wariant gemma4:31b-cloud daje pełną moc bez lokalnego GPU.

Qwen 3.5 i Qwen 3.6

Rodzina Alibaby. Qwen 3.5 to multimodal z tool-callingiem i thinkingiem, skalujący się od 0,8B do 122B lokalnie plus wariant cloud 397B; karta deklaruje obsługę 201 języków, więc to mocny wybór wielojęzyczny. Qwen 3.6 (27B/35B) skupia się na agentic coding i "zachowaniu myślenia" między krokami. Realne rozmiary: qwen3.5:9b to 6,6 GB, qwen3.5:27b to 17 GB, qwen3.6:27b również 17 GB. ollama pull qwen3.5:9b.

gpt-oss

Open-weight od OpenAI na licencji Apache 2.0, w wariantach 20B i 120B, z reasoningiem i tool-callingiem. Kluczowa zaleta: format MXFP4 sprawia, że gpt-oss:20b zajmuje 14 GB i mieści się w 16 GB RAM (mówi to wprost karta modelu), a gpt-oss:120b (65 GB) wchodzi na jeden 80 GB GPU. Oba mają też wariant -cloud. To najrozsądniejszy start na typowym desktopie z 16 GB pamięci. ollama pull gpt-oss:20b.

LFM2 i Granite 4

Do lekkich, wydajnych wdrożeń. LFM2 od Liquid AI to model on-device - lfm2:24b jest architekturą MoE z 2B aktywnymi parametrami i przy 14 GB pliku mieści się w 32 GB RAM, dając jakość większego modelu przy koszcie pamięci bliższym rozmiarowi pliku. IBM Granite 4 i 4.1 (od 350M po 30B) celują w zastosowania firmowe: RAG, tool-calling, multilingual. ollama pull lfm2:24b.

Nemotron 3 i modele agentic 30B

NVIDIA Nemotron 3 (Nano Omni, 33B) łączy wideo, audio, obraz i tekst. Wokół klasy 30-33B MoE z około 3B aktywnymi parametrami wyrosła cała fala modeli agentic-coding do lokalnego uruchomienia: glm-4.7-flash (30B), north-mini-code (Cohere), laguna-xs, nemotron-cascade-2, olmo-3:32b. To dobry kompromis mocy agentowej i wymagań pamięci na karcie 24 GB.

Najlepsze małe modele (do 8 GB RAM)

Konkret: jeśli masz laptopa lub mini-PC bez dedykowanego GPU, celuj w gemma4:e2b (7,2 GB) albo mniejsze warianty Qwen 3.5 - qwen3.5:4b (3,4 GB) czy qwen3.5:2b (2,7 GB). Te modele działają na samym CPU, GPU nie jest tu potrzebne.

Warianty warte uwagi:

  • qwen3.5:0.8b (1,0 GB) - bardzo szybki nawet na CPU, dobry do parsowania tekstu do JSON i prostych zadań.
  • gemma4:e2b (7,2 GB) - multimodal edge, obraz i audio na laptopie, gdy masy zapas pamięci.
  • Granite 4 (350M/1B/3B) i functiongemma:270m - skrajnie lekkie, function calling i edge.
  • LFM2.5 i MiniCPM-V 4.6 (1B) - modele "na telefon", część z tool-callingiem i vision.

Na tym sprzęcie liczy się kwantyzacja. Małe modele tracą na jakości mocniej niż duże, więc jeśli masz zapas pamięci, wybierz wariant Q6 lub Q8 zamiast domyślnego Q4 - różnicę zobaczysz szczególnie przy zadaniach wymagających precyzji, jak parsowanie do JSON czy krótkie polecenia strukturalne.

Na tym etapie nie kupuj karty graficznej. Jeśli chcesz postawić stały, cichy serwer LLM w domu lub firmie, sensowniejszy jest tani mini-PC albo NUC z 16-32 GB RAM niż osobne GPU - taki zestaw uciągnie modele do klasy 8-9B i pobiera niewiele prądu w spoczynku.

Najlepsze duże modele lokalne (24 GB+ VRAM)

Konkret: na karcie z 24 GB VRAM (RTX 3090 lub 4090) sweet spotem są gemma4:31b (20 GB), gemma4:26b (18 GB) oraz qwen3.6:27b / qwen3.5:27b (po 17 GB). To tu jakość lokalna zaczyna dorównywać komfortowi pracy. Do tego dochodzą modele 30-33B MoE z około 3B aktywnymi parametrami (glm-4.7-flash, nemotron-cascade-2, north-mini-code, laguna-xs), które przy sensownym rozmiarze pliku dają mocną pracę agentową.

Powyżej wchodzą modele serwerowe: gpt-oss:120b (65 GB, jeden 80 GB GPU), qwen3.5:122b (81 GB), qwen3-next:80b, nemotron-3-super:120b, mistral-medium-3.5:128b, a w skrajnych przypadkach deepseek-v3.1:671b. Do dużego kontekstu dobrym rozwiązaniem są setupy z 128 GB pamięci unified (Strix Halo, Framework Desktop) - najlepszy stosunek ceny do pojemności pamięci, kosztem przepustowości względem kart NVIDIA.

Trade-off: powyżej 128 GB (GLM-5.x z setkami miliardów parametrów, Kimi K2.x, MiniMax M3, DeepSeek V4-Pro) realnie nie ma sensownego uruchomienia lokalnego dla przeciętnego użytkownika - to domena Ollama Cloud. Jeśli potrzebujesz mocy takich modeli bez kupowania sprzętu, wybór jest prosty: Ollama Cloud albo wynajęty serwer GPU czy VPS pod LLM, gdzie płacisz za czas pracy. A jeśli karta jest, ale model z niej nie korzysta albo dostajesz błąd braku pamięci, zajrzyj do poradnika co robić, gdy model nie korzysta z GPU:** qwen3-coder (30B/480B, oba warianty cloud), qwen3-coder-next, devstral-2 (123B) i devstral-small-2 (24B) do eksploracji repozytoriów i pracy multi-file, a lokalnie klasa 30B MoE (glm-4.7-flash, north-mini-code). Frontier coding (GLM-5.x, Kimi K2.7-Code, DeepSeek V4, MiniMax M2.x/M3) jest głównie w Cloud. Pułapka: przy 8 GB VRAM kodowanie lokalne jest ograniczone - jeśli mały model daje słabe efekty, zwykle chodzi o za wysokie oczekiwania wobec jego rozmiaru.

  • Tool-calling i agenci (n8n): postaw na modele z tagiem tools i thinking - gpt-oss:20b, qwen3.5, granite4.1, lfm2. Pro tip: podnieś kontekst do 8-16K, ustaw niską temperaturę i użyj kwantyzacji Q6/Q8 zamiast domyślnego Q4. Najmniejsze modele (poniżej 3B) do tool-callingu zwykle się nie nadają.
  • Reasoning: modele z tagiem thinking - qwen3.6, gpt-oss, nemotron-3-nano, a w Cloud DeepSeek V4-Pro (poziom "extra heavy" w skali ciężkości).
  • Vision / multimodal: qwen3-vl (od 2B po 235B), gemma4 (obraz + audio), nemotron3 (Nano Omni: wideo/audio/obraz/tekst), MiniCPM-V 4.5/4.6.
  • Tłumaczenia i domeny: translategemma (55 języków), medgemma (medycyna, tekst + obraz), deepseek-ocr i glm-ocr (OCR), functiongemma (function calling).
  • Embeddingi (RAG): embeddinggemma (300M), qwen3-embedding (0,6B/4B/8B), klasyczny nomic-embed-text. Przydają się, gdy budujesz wyszukiwanie po dokumentach - najłatwiej połączysz je z interfejsem Open WebUI z obsługą RAG i embeddingów. W oficjalnej bibliotece Ollama nie ma dedykowanego polskiego modelu, ale w namespace społeczności znajdziesz najświeższą generację v3.0. Główny wariant to SpeakLeash/bielik-11b-v3.0-instruct (11B, z tool-callingiem), a mniejsze to qooba/bielik-4.5b-v3.0-instruct (4,5B) i qooba/bielik-1.5b-v3.0-instruct (1,5B) na słabszy sprzęt. Jest też destylowany bielik-minitron-7B-v3.0-instruct. To projekt edukacyjno-badawczy budowany wokół polskiego korpusu, więc rozumie polskie realia lepiej niż modele trenowane głównie na angielskim.

Ciekawostka dla programistów: rafw007/bielik-codex to lokalny agent kodujący po polsku, z API zgodnym z Anthropic - napędza Claude Code czy OpenCode w 100 procentach lokalnie.

Jeśli nie chcesz osobnego modelu, dobrą alternatywą wielojęzyczną są Qwen 3.5 (201 języków wg karty), Gemma 4 i Granite - radzą sobie po polsku dobrze, choć bez dedykowanego dostrojenia jak Bielik. W praktyce: do treści po polsku zestaw Bielika z jednym modelem wielojęzycznym i porównaj wyniki na swoich zadaniach. Krok po kroku pokazuję to w tekście jak uruchomić Bielika w Ollama / qwen3.5:9b. Przy stałym użyciu rozważ dedykowany mini-PC.

  • 24 GB VRAM (RTX 3090/4090) - gemma4:31b / qwen3.6:27b / modele 30B MoE. Tu jest sweet spot jakości lokalnie.
  • Serwer 48-128 GB - gpt-oss:120b / qwen3.5:122b / qwen3-next:80b.
  • Chcesz flagowca bez lokalnego GPU - Ollama Cloud (GLM-5.x, Kimi, DeepSeek V4, MiniMax M3) na planie Pro lub Max, albo własny serwer GPU/VPS.
Profil Rekomendowany model Tryb
laptop 8 GB gemma4:e2b / qwen3.5:4b Local, CPU wystarczy
16 GB RAM gpt-oss:20b / qwen3.5:9b Local
24 GB VRAM gemma4:31b / qwen3.6:27b Local
serwer 48-128 GB gpt-oss:120b / qwen3.5:122b Local
frontier agentic GLM-5.x / Kimi K2.7 / DeepSeek V4 / MiniMax M3 Ollama Cloud lub serwer GPU

Zanim pobierzesz model, upewnij się, że masz działające środowisko - zacznij od jak zainstalować Ollamę. Rynek modeli zmienia się dosłownie co tydzień, więc traktuj ten ranking jako profilowy i evergreen, a konkretne nowe wersje sprawdzaj w bibliotece Ollama przed pobraniem.

Jeśli docelowy model przekracza możliwości Twojego sprzętu, masz trzy drogi: dołożyć pamięci lub kartę (RTX 3090/4090 z 24 GB VRAM to lokalny sweet spot), sięgnąć po Ollama Cloud, albo wynająć serwer GPU czy VPS w chmurze i płacić za czas pracy. Konkret: zacznij od modelu, który realnie chcesz uruchamiać, i dopiero pod niego dobieraj sprzęt lub plan - nie odwrotnie. Ceny sprzętu, serwerów i planów Cloud zmieniają się z miesiąca na miesiąc, więc porównuj je wg aktualnej oferty.

FAQ - najczęstsze pytania

Czym różni się Ollama Cloud od modeli lokalnych?

Modele lokalne pobierasz i uruchamiasz na własnym CPU/GPU - dane nie opuszczają maszyny, a użycie jest bez limitu i za darmo. Ollama Cloud offloaduje model na serwery Ollamy, dzięki czemu uruchomisz flagowce, które nie zmieściłyby się w Twojej pamięci. Cloud wymaga planu (Free, Pro 20 $ lub Max 100 $) i wysyła dane do chmury, choć bez logowania.

Ile kosztuje Ollama Cloud i jak jest rozliczana?

Plan Free jest darmowy i daje lekki dostęp do cloud oraz nielimitowane modele lokalne. Pro kosztuje 20 $/mies (lub 200 $/rok), Max 100 $/mies. Rozliczenie nie jest per token - liczony jest realny czas GPU. Limity sesyjne resetują się co 5 godzin, a tygodniowe co 7 dni. Uruchamianie modeli lokalnie jest zawsze bez limitu.

Czym są modele Ollama?

Modele Ollama (Ollama models) to modele językowe z biblioteki ollama.com/library, które pobierasz komendą ollama pull i uruchamiasz lokalnie przez ollama run, albo - w wariancie z tagiem -cloud - na serwerach Ollamy. Każdy model ma tag rodziny plus rozmiar i wariant (np. gemma4:12b), a osobne warianty pokrywają czat, kod, reasoning, vision i embeddingi.

Który jest najlepszy model do Ollama w 2026 roku?

Zależy od sprzętu i trybu. Lokalnie do 8 GB wybierz gemma4:e2b lub qwen3.5:4b, do 16 GB gpt-oss:20b, przy 24 GB VRAM gemma4:31b lub qwen3.6:27b. Flagowce agentic (GLM-5.x, Kimi K2.7, DeepSeek V4, MiniMax M3) uruchomisz tylko w Cloud. Do polskiego sięgnij po Bielika 11B.

Jaki jest najszybszy model w Ollama?

Najszybsze są najmniejsze modele i architektury MoE z małą liczbą aktywnych parametrów. Do błyskawicznych odpowiedzi nawet na CPU sięgnij po qwen3.5:0.8b (1,0 GB) lub qwen3.5:2b (2,7 GB). Wśród większych szybkie są modele MoE jak lfm2:24b (2B aktywne) czy klasa 30B MoE - dają jakość dużego modelu przy prędkości bliższej małemu. Prędkość rośnie też, gdy cały model zmieści się w VRAM zamiast w RAM.

Ile RAM lub VRAM potrzebuje dany model Ollama?

Reguła kciuka: rozmiar pliku modelu plus 1-2 GB na kontekst. Przykłady z kart modeli: gpt-oss:20b to około 14 GB i mieści się w 16 GB RAM, gemma4:31b około 20 GB, qwen3.5:27b około 17 GB, a lfm2:24b (MoE) 14 GB i mieści się w 32 GB RAM. Tyle pamięci musisz mieć wolne.

Które modele działają tylko w chmurze, a które lokalnie?

Lokalnie pobierzesz między innymi Gemma 4, Qwen 3.5/3.6, gpt-oss, LFM2, Granite 4 i Bielika. Tylko w Cloud dostępne są największe flagowce: GLM-5, 5.1 i 5.2, Kimi K2.x, MiniMax M2.x i M3, DeepSeek V4-Pro oraz Nemotron 3 Ultra. Część rodzin (gemma4, qwen3.5, gpt-oss, deepseek-v3.1) ma oba warianty - mały lokalny i duży z tagiem -cloud.

Jak wyświetlić, zaktualizować lub usunąć model w Ollama?

Listę pobranych modeli pokaże ollama list (programowo endpoint /api/tags). Aktualizację lub nowszą wersję dociągniesz tą samą komendą ollama pull <tag> - Ollama pobierze zmienione warstwy. Żeby usunąć model i zwolnić miejsce, użyj ollama rm <tag>. Warto co jakiś czas przejrzeć ollama list i skasować warianty, których już nie używasz.