Szybka odpowiedź

Wybieraj model po zadaniu, sprzęcie i licencji, nie po rankingu. Po polsku sprawdź 2-3 kandydatów na 50-100 własnych przykładach, bo publiczne testy dają sprzeczne wyniki. Pod koniec sierpnia 2026 r. rozsądny start dla RAG i agentów na jednym GPU to model gęsty 27-31B z licencją Apache 2.0 (np. Qwen3.8-27B albo Gemma 4 31B). Polskie modele (Bielik v3, PLLuM) warto dołożyć do testu, gdy liczy się język, a sprzęt jest mniejszy. Modele powyżej 100 mld parametrów (Mistral Small 4, GLM-5.3-Flash) wymagają więcej pamięci, ale dają więcej jakości w trudnych zadaniach.

Wszystkie modele w tym tekście sprawdziliśmy na ich kartach na Hugging Face 31 sierpnia 2026 r. Ta dziedzina zmienia się co kwartał, dlatego artykuł aktualizujemy.

Jakie rodziny otwartych modeli warto znać?

RodzinaPrzykładowe modele (Hugging Face)Architektura i kontekstLicencjaUwagi
Qwen (Alibaba)Qwen3.8-27B, Qwen3.6-35B-A3B, Qwen3.8-Flash-Next27B gęsty z rozumieniem obrazów i wideo, kontekst 262 tys. (do 1 mln); 35B MoE; Flash-Next: 125B z 6B aktywnymi plus 51B embeddingów n-gramowychApache 2.0; Flash-Next: Qwen Community License 1.0tryb rozumowania domyślnie włączony, wyłączany per zapytanie; oficjalne wersje FP8
Gemma 4 (Google DeepMind)Gemma 4 31B, 26B A4B, 12B, E4B, E2Bgęste i MoE, kontekst 128 tys. (małe) lub 256 tys.; obrazy we wszystkich, audio w E2B, E4B i 12BApache 2.035+ języków od razu, trening na 140+; oficjalne wersje QAT 4-bitowe
GLM (Z.ai)GLM-4.7-Flash, GLM-5.3-Flash, GLM-5.34.7-Flash: MoE 30B-A3B; 5.3-Flash: 320B z 18B aktywnymi, multimodalny; 5.3: ok. 750BMIT; GLM-5.3: własna licencjawedług producenta mocne w kodzie i zadaniach agentowych; karta wymienia angielski i chiński
Mistral (Mistral AI)Ministral 3 14B, Mistral Small 4, Mistral Medium 3.5Ministral: 3B, 8B, 14B; Small 4: MoE 119B z 6,5B aktywnymi, kontekst 256 tys.; Medium 3.5: gęsty 128BApache 2.0; Medium 3.5: zmodyfikowana MITSmall 4 łączy tryb instrukcji, rozumowania i kodu; oficjalna wersja NVFP4
Bielik (SpeakLeash, ACK Cyfronet AGH)Bielik-11B-v3.0-Instruct, Bielik-PL-11B-v3.0-Instruct, Bielik-Minitron-7B-v3.0gęsty 11B (Minitron 7B)Apache 2.0, dostęp po akceptacji warunkówtrenowany z naciskiem na polski i 32 języki europejskie; wersja PL ma tokenizer zoptymalizowany pod polski
PLLuM (konsorcjum PLLuM, HIVE AI)PLLuM-12B-instruct-2512, Llama-PLLuM-70B-instruct-251212B na bazie Mistral Nemo; 70B na bazie Llamy 3.112B: Apache 2.0; 70B: licencja Llama 3.1polskie dane i ręcznie pisane instrukcje, nastawienie na administrację publiczną
gpt-oss (OpenAI)gpt-oss-20b, gpt-oss-120bMoE, wagi w 4 bitach (MXFP4)Apache 2.0dobry punkt odniesienia w testach

Tabela nie jest rankingiem. To lista kandydatów, z których wybierasz 2-3 do własnego testu.

Dlaczego ranking nie wystarczy?

Benchmarki publikowane przez producentów są liczone na ich własnych ustawieniach i zwykle po angielsku lub chińsku. Po polsku obraz jest niejednoznaczny:

  • Test Oxido z marca 2026 r. porównał 12 modeli w 20 zadaniach z 10 kategorii (e-maile, porady biznesowe, poprawność językowa, historia i kultura). Polskie modele, Bielik i PLLuM, znalazły się w dole stawki (Bankier.pl). Wynik wywołał spór, bo test był mały i oceniał głównie zadania ogólne.
  • Benchmark PLCC z Ośrodka Przetwarzania Informacji to 600 ręcznie przygotowanych pytań z historii, geografii, kultury, sztuki, gramatyki i słownictwa. Autorzy przetestowali ponad 30 modeli i stwierdzili, że modele komercyjne mają wyraźną przewagę, ale mały Bielik potrafi dorównać dużo większym modelom wielojęzycznym w rozumieniu polskiej kultury (Dadas i in., 2025).
  • Open PL LLM Leaderboard od SpeakLeash zbiera wyniki wielu zadań po polsku (Hugging Face). To dobry filtr wstępny, ale zadania testowe nie są Twoimi zadaniami.

Wniosek: ranking mówi, które modele warto przetestować. Nie mówi, który będzie najlepszy w Twojej bazie wiedzy, przy Twoich dokumentach i Twoich narzędziach.

Licencja: co sprawdzić przed wdrożeniem?

„Otwarty model” nie zawsze znaczy „dowolne użycie”. Różnice, które znaleźliśmy w kartach modeli:

LicencjaPrzykładyNa co uważać
Apache 2.0Qwen3.8-27B, Qwen3.6, Gemma 4, Mistral Small 4, Ministral 3, Bielik v3, PLLuM-12B, gpt-ossbrak dodatkowych warunków; Bielik wymaga akceptacji warunków dostępu na Hugging Face
MITGLM-4.7-Flash, GLM-5.3-Flashbrak dodatkowych warunków
Licencja GLM-5.3GLM-5.3dostawca Model as a Service z przychodem powyżej 10 mld USD rocznie musi przejść przegląd bezpieczeństwa Z.ai
Qwen Community License 1.0Qwen3.8-Flash-Nextusługa udostępniająca model innym (Model as a Service, asystent AI dla klientów) wymaga osobnej licencji od Qwen; użycie wewnętrzne jest dozwolone
Zmodyfikowana MITMistral Medium 3.5brak praw dla firm z miesięcznym przychodem powyżej 20 mln USD
Llama 3.1Llama-PLLuM-70Bwarunki licencji Mety

Jeśli budujesz produkt, w którym klienci korzystają z modelu, licencja ma znaczenie od pierwszego dnia. To nie jest porada prawna: przy wątpliwościach daj licencję do przeczytania prawnikowi.

Jaki model zmieści się na Twoim sprzęcie?

Pamięć liczy się od wszystkich parametrów, szybkość od aktywnych. Model MoE 35B-A3B generuje szybko jak model 3B, ale w pamięci zajmuje tyle co 35B. Szczegółowe wyliczenia pamięci wag i cache KV są w przewodniku ile VRAM do lokalnego LLM, część 1 i część 2. W skrócie:

SprzętRozsądni kandydaci
Laptop, karta 16 GBGemma 4 E4B lub 12B, Ministral 3 8B, Bielik-Minitron-7B, gpt-oss-20b
Karta 24-32 GBGemma 4 12B, Gemma 4 26B A4B w 4 bitach, Bielik 11B, PLLuM-12B, Qwen3.6-35B-A3B w 4 bitach (na 32 GB)
Karta 96 GBQwen3.8-27B lub Gemma 4 31B w FP8 dla wielu użytkowników, GLM-4.7-Flash, Mistral Small 4 w NVFP4
Kilka kart lub GPU klasy B200/B300GLM-5.3-Flash, Mistral Medium 3.5, większe modele MoE

Format wag też ma znaczenie: oficjalne wersje FP8 (Qwen), NVFP4 (Mistral) czy QAT 4-bit (Gemma) zwykle trzymają jakość lepiej niż kwantyzacje robione przez społeczność. Więcej o tym w artykule FP8, NVFP4 czy AWQ.

Jak przetestować modele na własnych przykładach?

To najważniejsza część wyboru i zajmuje zwykle kilka dni.

  1. Zbierz 50-100 prawdziwych zapytań. Z historii zgłoszeń, z maili, od użytkowników pilotażu. Dodaj trudne przypadki: pytania bez odpowiedzi w dokumentach, nieprecyzyjne, z błędami, mieszające polski z angielskim.
  2. Zapisz oczekiwane odpowiedzi albo kryteria poprawnej odpowiedzi. Bez tego ocena będzie oparta na wrażeniu.
  3. Ustal kryteria. Poprawność merytoryczna, zgodność ze źródłem, poprawność polszczyzny, format (JSON, wywołanie narzędzia), długość, czas odpowiedzi.
  4. Wybierz 2-3 kandydatów z tabeli wyżej, pasujących do sprzętu i licencji.
  5. Uruchom wszystkich na tych samych ustawieniach: ten sam prompt systemowy, te same fragmenty dokumentów z RAG, ta sama temperatura, ten sam silnik (vLLM czy SGLang).
  6. Oceń wyniki. Ręcznie na całości albo modelem oceniającym, którego oceny sprawdzisz ręcznie na próbce 20-30 odpowiedzi.
  7. Zapisz zestaw jako test regresyjny. Puszczasz go przy każdej nowej wersji modelu, silnika albo promptu.

Na co zwracać uwagę poza samą poprawnością:

  • Tryb rozumowania. Część modeli domyślnie „myśli” przed odpowiedzią. To poprawia trudne zadania, ale wydłuża czas odpowiedzi i zużywa tokeny. Sprawdź, czy da się go wyłączyć per zapytanie.
  • Język rozumowania i odpowiedzi. Model może rozumować po angielsku, a odpowiadać po polsku. Przy limicie tokenów odpowiedź potrafi się nie zmieścić.
  • Wywołania narzędzi. Dla agentów liczy się, czy model wywołuje właściwe narzędzie z poprawnymi argumentami, a nie tylko jakość tekstu.
  • Trzymanie się źródeł. W bazie wiedzy model ma odpowiadać z dokumentów i mówić „nie wiem”, gdy odpowiedzi w nich nie ma.

Który model do jakiego zadania?

ZadanieNa co patrzećKandydaci do testu
RAG po polsku, baza wiedzytrzymanie się źródeł, długi kontekst, polszczyznaQwen3.8-27B, Gemma 4 31B, Bielik 11B v3, Mistral Small 4
Agenci z narzędziamijakość wywołań narzędzi, długie sesjeQwen3.8-27B, GLM-4.7-Flash lub GLM-5.3-Flash, Mistral Small 4
Klasyfikacja, ekstrakcjastały format, szybkość, możliwość dotrenowaniamałe modele (Gemma 4 12B, Ministral 3, Bielik-Minitron) z LoRA
Dokumenty ze skanami i obrazamirozumienie obrazówQwen3.8-27B, Gemma 4, GLM-5.3-Flash
Sprzęt brzegowy, laptoprozmiar, audioGemma 4 E2B lub E4B

Przy klasyfikacji i ekstrakcji często lepszy od dużego modelu z promptem jest mały model dotrenowany LoRA. Przykład krok po kroku opisujemy w artykule mały model z LoRA czy duży model z promptem.

Jak to robimy u siebie

Serwujemy modele z rodzin Qwen, Gemma, GLM i Mistral na własnych GPU NVIDIA Blackwell i porównujemy kolejne generacje w praktyce. Każdą zmianę modelu poprzedza test na zestawie prawdziwych zadań agentów i pytań do bazy wiedzy. Kilka obserwacji z tych testów:

  • Lepszy wynik w benchmarku producenta nie zawsze oznaczał lepszego agenta. Bywało, że model z domyślnie włączonym rozumowaniem zużywał limit tokenów na długie rozumowanie po angielsku i nie zdążył odpowiedzieć po polsku.
  • Ten sam model w innej kwantyzacji albo na innej wersji silnika potrafił zachowywać się inaczej przy wywołaniach narzędzi, choć zwykłe odpowiedzi wyglądały tak samo.
  • W jednym z naszych porównań model gęsty ok. 30B trzymał się promptu systemowego i pisał lepszą polszczyzną niż model MoE z kilkoma miliardami aktywnych parametrów, a przy tym odpowiadał szybciej, bo nie rozumował domyślnie. To wynik dla jednej pary modeli i jednego zadania, nie reguła.

Jeśli chcesz porównać kilka modeli na swoich danych, możesz zamówić demo. Jak dobieramy i dostrajamy modele, opisujemy na stronie Modele i fine-tuning, a kiedy w ogóle wybierać model otwarty zamiast API, w artykule ile kosztuje lokalny LLM.

Lista kontrolna wyboru modelu

  1. Zadanie jest opisane jednym zdaniem i ma mierzalne kryterium sukcesu.
  2. Znasz budżet pamięci GPU i liczbę równoległych użytkowników.
  3. Licencja kandydatów pasuje do sposobu użycia (wewnętrznie czy w produkcie dla klientów).
  4. Masz 50-100 przykładów z oczekiwanymi odpowiedziami.
  5. Testujesz 2-3 modele na identycznych ustawieniach.
  6. Sprawdzasz osobno jakość polszczyzny, trzymanie się źródeł i wywołania narzędzi.
  7. Mierzysz czas odpowiedzi przy realnej liczbie użytkowników.
  8. Zestaw testowy zostaje jako test regresyjny przy kolejnych wersjach.

Źródła

Karty modeli na Hugging Face (stan na 31 sierpnia 2026):

Testy i benchmarki po polsku: