Szybka odpowiedź
Wybieraj model po zadaniu, sprzęcie i licencji, nie po rankingu. Po polsku sprawdź 2-3 kandydatów na 50-100 własnych przykładach, bo publiczne testy dają sprzeczne wyniki. Pod koniec sierpnia 2026 r. rozsądny start dla RAG i agentów na jednym GPU to model gęsty 27-31B z licencją Apache 2.0 (np. Qwen3.8-27B albo Gemma 4 31B). Polskie modele (Bielik v3, PLLuM) warto dołożyć do testu, gdy liczy się język, a sprzęt jest mniejszy. Modele powyżej 100 mld parametrów (Mistral Small 4, GLM-5.3-Flash) wymagają więcej pamięci, ale dają więcej jakości w trudnych zadaniach.
Wszystkie modele w tym tekście sprawdziliśmy na ich kartach na Hugging Face 31 sierpnia 2026 r. Ta dziedzina zmienia się co kwartał, dlatego artykuł aktualizujemy.
Jakie rodziny otwartych modeli warto znać?
| Rodzina | Przykładowe modele (Hugging Face) | Architektura i kontekst | Licencja | Uwagi |
|---|---|---|---|---|
| Qwen (Alibaba) | Qwen3.8-27B, Qwen3.6-35B-A3B, Qwen3.8-Flash-Next | 27B gęsty z rozumieniem obrazów i wideo, kontekst 262 tys. (do 1 mln); 35B MoE; Flash-Next: 125B z 6B aktywnymi plus 51B embeddingów n-gramowych | Apache 2.0; Flash-Next: Qwen Community License 1.0 | tryb rozumowania domyślnie włączony, wyłączany per zapytanie; oficjalne wersje FP8 |
| Gemma 4 (Google DeepMind) | Gemma 4 31B, 26B A4B, 12B, E4B, E2B | gęste i MoE, kontekst 128 tys. (małe) lub 256 tys.; obrazy we wszystkich, audio w E2B, E4B i 12B | Apache 2.0 | 35+ języków od razu, trening na 140+; oficjalne wersje QAT 4-bitowe |
| GLM (Z.ai) | GLM-4.7-Flash, GLM-5.3-Flash, GLM-5.3 | 4.7-Flash: MoE 30B-A3B; 5.3-Flash: 320B z 18B aktywnymi, multimodalny; 5.3: ok. 750B | MIT; GLM-5.3: własna licencja | według producenta mocne w kodzie i zadaniach agentowych; karta wymienia angielski i chiński |
| Mistral (Mistral AI) | Ministral 3 14B, Mistral Small 4, Mistral Medium 3.5 | Ministral: 3B, 8B, 14B; Small 4: MoE 119B z 6,5B aktywnymi, kontekst 256 tys.; Medium 3.5: gęsty 128B | Apache 2.0; Medium 3.5: zmodyfikowana MIT | Small 4 łączy tryb instrukcji, rozumowania i kodu; oficjalna wersja NVFP4 |
| Bielik (SpeakLeash, ACK Cyfronet AGH) | Bielik-11B-v3.0-Instruct, Bielik-PL-11B-v3.0-Instruct, Bielik-Minitron-7B-v3.0 | gęsty 11B (Minitron 7B) | Apache 2.0, dostęp po akceptacji warunków | trenowany z naciskiem na polski i 32 języki europejskie; wersja PL ma tokenizer zoptymalizowany pod polski |
| PLLuM (konsorcjum PLLuM, HIVE AI) | PLLuM-12B-instruct-2512, Llama-PLLuM-70B-instruct-2512 | 12B na bazie Mistral Nemo; 70B na bazie Llamy 3.1 | 12B: Apache 2.0; 70B: licencja Llama 3.1 | polskie dane i ręcznie pisane instrukcje, nastawienie na administrację publiczną |
| gpt-oss (OpenAI) | gpt-oss-20b, gpt-oss-120b | MoE, wagi w 4 bitach (MXFP4) | Apache 2.0 | dobry punkt odniesienia w testach |
Tabela nie jest rankingiem. To lista kandydatów, z których wybierasz 2-3 do własnego testu.
Dlaczego ranking nie wystarczy?
Benchmarki publikowane przez producentów są liczone na ich własnych ustawieniach i zwykle po angielsku lub chińsku. Po polsku obraz jest niejednoznaczny:
- Test Oxido z marca 2026 r. porównał 12 modeli w 20 zadaniach z 10 kategorii (e-maile, porady biznesowe, poprawność językowa, historia i kultura). Polskie modele, Bielik i PLLuM, znalazły się w dole stawki (Bankier.pl). Wynik wywołał spór, bo test był mały i oceniał głównie zadania ogólne.
- Benchmark PLCC z Ośrodka Przetwarzania Informacji to 600 ręcznie przygotowanych pytań z historii, geografii, kultury, sztuki, gramatyki i słownictwa. Autorzy przetestowali ponad 30 modeli i stwierdzili, że modele komercyjne mają wyraźną przewagę, ale mały Bielik potrafi dorównać dużo większym modelom wielojęzycznym w rozumieniu polskiej kultury (Dadas i in., 2025).
- Open PL LLM Leaderboard od SpeakLeash zbiera wyniki wielu zadań po polsku (Hugging Face). To dobry filtr wstępny, ale zadania testowe nie są Twoimi zadaniami.
Wniosek: ranking mówi, które modele warto przetestować. Nie mówi, który będzie najlepszy w Twojej bazie wiedzy, przy Twoich dokumentach i Twoich narzędziach.
Licencja: co sprawdzić przed wdrożeniem?
„Otwarty model” nie zawsze znaczy „dowolne użycie”. Różnice, które znaleźliśmy w kartach modeli:
| Licencja | Przykłady | Na co uważać |
|---|---|---|
| Apache 2.0 | Qwen3.8-27B, Qwen3.6, Gemma 4, Mistral Small 4, Ministral 3, Bielik v3, PLLuM-12B, gpt-oss | brak dodatkowych warunków; Bielik wymaga akceptacji warunków dostępu na Hugging Face |
| MIT | GLM-4.7-Flash, GLM-5.3-Flash | brak dodatkowych warunków |
| Licencja GLM-5.3 | GLM-5.3 | dostawca Model as a Service z przychodem powyżej 10 mld USD rocznie musi przejść przegląd bezpieczeństwa Z.ai |
| Qwen Community License 1.0 | Qwen3.8-Flash-Next | usługa udostępniająca model innym (Model as a Service, asystent AI dla klientów) wymaga osobnej licencji od Qwen; użycie wewnętrzne jest dozwolone |
| Zmodyfikowana MIT | Mistral Medium 3.5 | brak praw dla firm z miesięcznym przychodem powyżej 20 mln USD |
| Llama 3.1 | Llama-PLLuM-70B | warunki licencji Mety |
Jeśli budujesz produkt, w którym klienci korzystają z modelu, licencja ma znaczenie od pierwszego dnia. To nie jest porada prawna: przy wątpliwościach daj licencję do przeczytania prawnikowi.
Jaki model zmieści się na Twoim sprzęcie?
Pamięć liczy się od wszystkich parametrów, szybkość od aktywnych. Model MoE 35B-A3B generuje szybko jak model 3B, ale w pamięci zajmuje tyle co 35B. Szczegółowe wyliczenia pamięci wag i cache KV są w przewodniku ile VRAM do lokalnego LLM, część 1 i część 2. W skrócie:
| Sprzęt | Rozsądni kandydaci |
|---|---|
| Laptop, karta 16 GB | Gemma 4 E4B lub 12B, Ministral 3 8B, Bielik-Minitron-7B, gpt-oss-20b |
| Karta 24-32 GB | Gemma 4 12B, Gemma 4 26B A4B w 4 bitach, Bielik 11B, PLLuM-12B, Qwen3.6-35B-A3B w 4 bitach (na 32 GB) |
| Karta 96 GB | Qwen3.8-27B lub Gemma 4 31B w FP8 dla wielu użytkowników, GLM-4.7-Flash, Mistral Small 4 w NVFP4 |
| Kilka kart lub GPU klasy B200/B300 | GLM-5.3-Flash, Mistral Medium 3.5, większe modele MoE |
Format wag też ma znaczenie: oficjalne wersje FP8 (Qwen), NVFP4 (Mistral) czy QAT 4-bit (Gemma) zwykle trzymają jakość lepiej niż kwantyzacje robione przez społeczność. Więcej o tym w artykule FP8, NVFP4 czy AWQ.
Jak przetestować modele na własnych przykładach?
To najważniejsza część wyboru i zajmuje zwykle kilka dni.
- Zbierz 50-100 prawdziwych zapytań. Z historii zgłoszeń, z maili, od użytkowników pilotażu. Dodaj trudne przypadki: pytania bez odpowiedzi w dokumentach, nieprecyzyjne, z błędami, mieszające polski z angielskim.
- Zapisz oczekiwane odpowiedzi albo kryteria poprawnej odpowiedzi. Bez tego ocena będzie oparta na wrażeniu.
- Ustal kryteria. Poprawność merytoryczna, zgodność ze źródłem, poprawność polszczyzny, format (JSON, wywołanie narzędzia), długość, czas odpowiedzi.
- Wybierz 2-3 kandydatów z tabeli wyżej, pasujących do sprzętu i licencji.
- Uruchom wszystkich na tych samych ustawieniach: ten sam prompt systemowy, te same fragmenty dokumentów z RAG, ta sama temperatura, ten sam silnik (vLLM czy SGLang).
- Oceń wyniki. Ręcznie na całości albo modelem oceniającym, którego oceny sprawdzisz ręcznie na próbce 20-30 odpowiedzi.
- Zapisz zestaw jako test regresyjny. Puszczasz go przy każdej nowej wersji modelu, silnika albo promptu.
Na co zwracać uwagę poza samą poprawnością:
- Tryb rozumowania. Część modeli domyślnie „myśli” przed odpowiedzią. To poprawia trudne zadania, ale wydłuża czas odpowiedzi i zużywa tokeny. Sprawdź, czy da się go wyłączyć per zapytanie.
- Język rozumowania i odpowiedzi. Model może rozumować po angielsku, a odpowiadać po polsku. Przy limicie tokenów odpowiedź potrafi się nie zmieścić.
- Wywołania narzędzi. Dla agentów liczy się, czy model wywołuje właściwe narzędzie z poprawnymi argumentami, a nie tylko jakość tekstu.
- Trzymanie się źródeł. W bazie wiedzy model ma odpowiadać z dokumentów i mówić „nie wiem”, gdy odpowiedzi w nich nie ma.
Który model do jakiego zadania?
| Zadanie | Na co patrzeć | Kandydaci do testu |
|---|---|---|
| RAG po polsku, baza wiedzy | trzymanie się źródeł, długi kontekst, polszczyzna | Qwen3.8-27B, Gemma 4 31B, Bielik 11B v3, Mistral Small 4 |
| Agenci z narzędziami | jakość wywołań narzędzi, długie sesje | Qwen3.8-27B, GLM-4.7-Flash lub GLM-5.3-Flash, Mistral Small 4 |
| Klasyfikacja, ekstrakcja | stały format, szybkość, możliwość dotrenowania | małe modele (Gemma 4 12B, Ministral 3, Bielik-Minitron) z LoRA |
| Dokumenty ze skanami i obrazami | rozumienie obrazów | Qwen3.8-27B, Gemma 4, GLM-5.3-Flash |
| Sprzęt brzegowy, laptop | rozmiar, audio | Gemma 4 E2B lub E4B |
Przy klasyfikacji i ekstrakcji często lepszy od dużego modelu z promptem jest mały model dotrenowany LoRA. Przykład krok po kroku opisujemy w artykule mały model z LoRA czy duży model z promptem.
Jak to robimy u siebie
Serwujemy modele z rodzin Qwen, Gemma, GLM i Mistral na własnych GPU NVIDIA Blackwell i porównujemy kolejne generacje w praktyce. Każdą zmianę modelu poprzedza test na zestawie prawdziwych zadań agentów i pytań do bazy wiedzy. Kilka obserwacji z tych testów:
- Lepszy wynik w benchmarku producenta nie zawsze oznaczał lepszego agenta. Bywało, że model z domyślnie włączonym rozumowaniem zużywał limit tokenów na długie rozumowanie po angielsku i nie zdążył odpowiedzieć po polsku.
- Ten sam model w innej kwantyzacji albo na innej wersji silnika potrafił zachowywać się inaczej przy wywołaniach narzędzi, choć zwykłe odpowiedzi wyglądały tak samo.
- W jednym z naszych porównań model gęsty ok. 30B trzymał się promptu systemowego i pisał lepszą polszczyzną niż model MoE z kilkoma miliardami aktywnych parametrów, a przy tym odpowiadał szybciej, bo nie rozumował domyślnie. To wynik dla jednej pary modeli i jednego zadania, nie reguła.
Jeśli chcesz porównać kilka modeli na swoich danych, możesz zamówić demo. Jak dobieramy i dostrajamy modele, opisujemy na stronie Modele i fine-tuning, a kiedy w ogóle wybierać model otwarty zamiast API, w artykule ile kosztuje lokalny LLM.
Lista kontrolna wyboru modelu
- Zadanie jest opisane jednym zdaniem i ma mierzalne kryterium sukcesu.
- Znasz budżet pamięci GPU i liczbę równoległych użytkowników.
- Licencja kandydatów pasuje do sposobu użycia (wewnętrznie czy w produkcie dla klientów).
- Masz 50-100 przykładów z oczekiwanymi odpowiedziami.
- Testujesz 2-3 modele na identycznych ustawieniach.
- Sprawdzasz osobno jakość polszczyzny, trzymanie się źródeł i wywołania narzędzi.
- Mierzysz czas odpowiedzi przy realnej liczbie użytkowników.
- Zestaw testowy zostaje jako test regresyjny przy kolejnych wersjach.
Źródła
Karty modeli na Hugging Face (stan na 31 sierpnia 2026):
- Qwen/Qwen3.8-27B, Qwen/Qwen3.8-27B-FP8, Qwen/Qwen3.6-35B-A3B, Qwen/Qwen3.8-Flash-Next
- google/gemma-4-31B-it, google/gemma-4-31B-it-qat-w4a16-ct
- zai-org/GLM-4.7-Flash, zai-org/GLM-5.3-Flash, zai-org/GLM-5.3
- mistralai/Ministral-3-14B-Instruct-2512, mistralai/Mistral-Small-4-119B-2603, mistralai/Mistral-Medium-3.5-128B
- speakleash/Bielik-11B-v3.0-Instruct, speakleash/Bielik-PL-11B-v3.0-Instruct
- CYFRAGOVPL/PLLuM-12B-instruct-2512
- openai/gpt-oss-20b, openai/gpt-oss-120b
Testy i benchmarki po polsku:
- Bankier.pl: Polska AI przegrała z gigantami. Bielik i PLLuM wypadły słabo w testach (17.03.2026)
- Dadas i in.: Evaluating Polish linguistic and cultural competency in large language models (2025)
- SpeakLeash: Open PL LLM Leaderboard
- Bielik 11B v3: Multilingual Large Language Model for European Languages
