
Model, który zna Twoją branżę.
Dostrajamy małe modele open-source na Twoich danych. Uczą się, o co pytają Twoi ludzie, i odpowiadają w formacie, z którym pracują Twoje systemy.
11 typów zapytań · ~240 ms na klasyfikację
Mały model, który zna Twoje pytania, odpowiedzi i formaty.
Duże modele ogólne wiedzą wszystko po trochu. Dostrojony mały model robi jedną rzecz dobrze, szybko i na Twoim sprzęcie. Poniżej pokazujemy cały proces na prawdziwym treningu klasyfikatora dla doradcy ubezpieczeniowego: od danych, przez jeden krok treningu, po model, który kieruje pytania do właściwej wiedzy.
Najpierw dane, potem trening
Model uczy się wyłącznie z przykładów. Zbieramy je z trzech źródeł: prawdziwe pytania z firmy, warianty syntetyczne i pary pytanie–odpowiedź wyciągnięte z dokumentów. Czyścimy je, dzielimy na trening i walidację i zapisujemy w formacie czatu.
- 01Trzy źródła przykładów
- 02Czyszczenie i anonimizacja
- 03Podział train / val
- 04Format czatu

Jeden przykład, jeden krok treningu
Tak wygląda pojedynczy krok: przykład zamienia się w tokeny, model zgaduje odpowiedź, liczymy błąd tylko na odpowiedzi, a gradient poprawia wyłącznie małe adaptery LoRA. Trening to ten sam krok powtórzony na wszystkich przykładach, przez 3 epoki.
- 01Przykład rozpada się na tokeny
- 02Model zgaduje odpowiedź
- 03Błąd liczymy tylko na odpowiedzi
- 04Uczą się tylko adaptery LoRA

r i α: pojemność i siła adaptera
Adapter LoRA to dwie wąskie macierze B i A dopięte do zamrożonych wag. Rząd r mówi, ile niezależnych kierunków zmian adapter może zapisać, a α skaluje, jak mocno ta zmiana wpływa na model. To czysta mechanika, nie wynik: w naszym treningu r = 16, α = 32.
- 01r: rząd, czyli pojemność
- 02α: skala zmiany
- 03Ustawienie z naszego treningu

Trzy epoki, 6 min 39 s
Strata treningowa spada z 2,34 do 0,07, a walidacyjna, liczona na pytaniach, których model nie widział, z 0,086 do 0,025. Cały trening zajął 6 min 39 s na jednym GPU NVIDIA Blackwell. Obok: jak w tym czasie zmienia się odpowiedź na jedno pytanie.
- 01Epoka 1: największy spadek
- 02Kolejne epoki: dopracowanie
- 03Wynik na walidacji

To samo pytanie, dwa modele
Model bazowy odpowiada ogólnikiem, który ktoś musi przeczytać. Model dostrojony zwraca krótki JSON: typ zapytania, produkt i flagi, które system rozumie od razu. Przykłady są fikcyjne i pokazują zasadę, nie wynik testu.
- 01Pytanie trafia do obu modeli
- 02Tekst kontra JSON
- 03Routing do wiedzy
- 04Werdykt

~240 ms i pytanie jest we właściwym miejscu
Dostrojony model działa jako klasyfikator przed właściwym asystentem. Serwujemy go przez vLLM, który łączy zapytania w partie na jednym GPU. Każde pytanie dostaje jeden z 11 typów i trafia do wiedzy, która na nie odpowiada.
- 01Zapytania doradców
- 02Partie w vLLM
- 03JSON w ~240 ms
- 04Routing do 11 typów

Wagi i dane zostają u Ciebie
Dane treningowe, model bazowy, adapter LoRA i serwer inferencji działają na Twojej infrastrukturze. Adapter to mały plik, który należy do Ciebie. Pytania pracowników nie wychodzą do zewnętrznych API.
- 01Granica infrastruktury
- 02Dane, model, adapter
- 03Zapytania zespołu
- 04Bez wyjścia na zewnątrz

Masz pytania, które ciągle wracają? Nauczmy model Twojej branży.
Zaczynamy od przeglądu danych i jednego konkretnego zadania: klasyfikacji, ekstrakcji albo formatu odpowiedzi. Pierwszy trening robimy na Twoich przykładach, a model zostaje na Twojej infrastrukturze.
Prawdziwe wartości z treningu: czas 6 min 39 s na jednym GPU NVIDIA Blackwell, strata treningowa 2,34 → 0,41 → 0,13 → 0,07 → 0,07, walidacyjna 0,086 → 0,032 → 0,025, LoRA r = 16, α = 32, 11 typów zapytań, ~240 ms na klasyfikację.
Ilustracja mechaniki: pytania, odpowiedzi i dokumenty (fikcyjne), ID tokenów, prawdopodobieństwa, rozbicie straty, mapy wag, przebieg linii między punktami krzywej, nazwy typów zapytań i źródeł wiedzy, wymiar d w przykładzie LoRA.