pimento · modele i fine-tuning

Model, który zna Twoją branżę.

Dostrajamy małe modele open-source na Twoich danych. Uczą się, o co pytają Twoi ludzie, i odpowiadają w formacie, z którym pracują Twoje systemy.

6 min 39 s treningu na 1 GPU NVIDIA Blackwell
11 typów zapytań · ~240 ms na klasyfikację
Modele i fine-tuning · od kuchni

Mały model, który zna Twoje pytania, odpowiedzi i formaty.

Duże modele ogólne wiedzą wszystko po trochu. Dostrojony mały model robi jedną rzecz dobrze, szybko i na Twoim sprzęcie. Poniżej pokazujemy cały proces na prawdziwym treningu klasyfikatora dla doradcy ubezpieczeniowego: od danych, przez jeden krok treningu, po model, który kieruje pytania do właściwej wiedzy.

  1. 01dane
  2. 02krok treningu
  3. 03pokrętła LoRA
  4. 04krzywa uczenia
  5. 05przed i po
  6. 06serwowanie
  7. 07Twoje dane
01 · dane

Najpierw dane, potem trening

Model uczy się wyłącznie z przykładów. Zbieramy je z trzech źródeł: prawdziwe pytania z firmy, warianty syntetyczne i pary pytanie–odpowiedź wyciągnięte z dokumentów. Czyścimy je, dzielimy na trening i walidację i zapisujemy w formacie czatu.

  1. 01Trzy źródła przykładów
  2. 02Czyszczenie i anonimizacja
  3. 03Podział train / val
  4. 04Format czatu
Dalej: co dzieje się z jednym takim wierszem w trakcie treningu.
02 · jeden krok treningu

Jeden przykład, jeden krok treningu

Tak wygląda pojedynczy krok: przykład zamienia się w tokeny, model zgaduje odpowiedź, liczymy błąd tylko na odpowiedzi, a gradient poprawia wyłącznie małe adaptery LoRA. Trening to ten sam krok powtórzony na wszystkich przykładach, przez 3 epoki.

  1. 01Przykład rozpada się na tokeny
  2. 02Model zgaduje odpowiedź
  3. 03Błąd liczymy tylko na odpowiedzi
  4. 04Uczą się tylko adaptery LoRA
Dalej: dwa pokrętła, którymi ustawiamy adapter.
03 · pokrętła LoRA

r i α: pojemność i siła adaptera

Adapter LoRA to dwie wąskie macierze B i A dopięte do zamrożonych wag. Rząd r mówi, ile niezależnych kierunków zmian adapter może zapisać, a α skaluje, jak mocno ta zmiana wpływa na model. To czysta mechanika, nie wynik: w naszym treningu r = 16, α = 32.

  1. 01r: rząd, czyli pojemność
  2. 02α: skala zmiany
  3. 03Ustawienie z naszego treningu
spróbujprzełącz r i α w ramce sceny
Dalej: co się dzieje, gdy ten krok powtarzamy przez trzy epoki.
04 · krzywa uczenia

Trzy epoki, 6 min 39 s

Strata treningowa spada z 2,34 do 0,07, a walidacyjna, liczona na pytaniach, których model nie widział, z 0,086 do 0,025. Cały trening zajął 6 min 39 s na jednym GPU NVIDIA Blackwell. Obok: jak w tym czasie zmienia się odpowiedź na jedno pytanie.

  1. 01Epoka 1: największy spadek
  2. 02Kolejne epoki: dopracowanie
  3. 03Wynik na walidacji
spróbujprzesuń suwak epok w ramce
Dalej: to samo pytanie, model przed i po treningu.
05 · przed i po

To samo pytanie, dwa modele

Model bazowy odpowiada ogólnikiem, który ktoś musi przeczytać. Model dostrojony zwraca krótki JSON: typ zapytania, produkt i flagi, które system rozumie od razu. Przykłady są fikcyjne i pokazują zasadę, nie wynik testu.

  1. 01Pytanie trafia do obu modeli
  2. 02Tekst kontra JSON
  3. 03Routing do wiedzy
  4. 04Werdykt
spróbujwybierz pytanie pod sceną
Dalej: gdzie ten JSON trafia na produkcji.
06 · mały model, duża robota

~240 ms i pytanie jest we właściwym miejscu

Dostrojony model działa jako klasyfikator przed właściwym asystentem. Serwujemy go przez vLLM, który łączy zapytania w partie na jednym GPU. Każde pytanie dostaje jeden z 11 typów i trafia do wiedzy, która na nie odpowiada.

  1. 01Zapytania doradców
  2. 02Partie w vLLM
  3. 03JSON w ~240 ms
  4. 04Routing do 11 typów
Dalej: gdzie to wszystko działa i do kogo należy.
07 · twój model, twoje dane

Wagi i dane zostają u Ciebie

Dane treningowe, model bazowy, adapter LoRA i serwer inferencji działają na Twojej infrastrukturze. Adapter to mały plik, który należy do Ciebie. Pytania pracowników nie wychodzą do zewnętrznych API.

  1. 01Granica infrastruktury
  2. 02Dane, model, adapter
  3. 03Zapytania zespołu
  4. 04Bez wyjścia na zewnątrz
Dalej: porozmawiajmy o Twoich danych.
Porozmawiajmy

Masz pytania, które ciągle wracają? Nauczmy model Twojej branży.

Zaczynamy od przeglądu danych i jednego konkretnego zadania: klasyfikacji, ekstrakcji albo formatu odpowiedzi. Pierwszy trening robimy na Twoich przykładach, a model zostaje na Twojej infrastrukturze.

6 min 39 strening klasyfikatora · 1 GPU NVIDIA Blackwell
2,34 → 0,07strata treningowa w 3 epokach
0,025strata walidacyjna po 3. epoce
~240 msna jedną klasyfikację
11typów zapytań rozpoznawanych przez model
r = 16, α = 32LoRA na q, k, v, o, gate, up, down

Prawdziwe wartości z treningu: czas 6 min 39 s na jednym GPU NVIDIA Blackwell, strata treningowa 2,34 → 0,41 → 0,13 → 0,07 → 0,07, walidacyjna 0,086 → 0,032 → 0,025, LoRA r = 16, α = 32, 11 typów zapytań, ~240 ms na klasyfikację.

Ilustracja mechaniki: pytania, odpowiedzi i dokumenty (fikcyjne), ID tokenów, prawdopodobieństwa, rozbicie straty, mapy wag, przebieg linii między punktami krzywej, nazwy typów zapytań i źródeł wiedzy, wymiar d w przykładzie LoRA.