Szybka odpowiedź

RAG (Retrieval-Augmented Generation, generowanie wspomagane wyszukiwaniem) to technika, w której model językowy przed odpowiedzią wyszukuje informacje w aktualnych źródłach, na przykład dokumentach i bazach Twojej firmy, i odpowiada na ich podstawie, często z przypisem. Dzięki temu AI może korzystać z bieżących i prywatnych danych bez trenowania modelu od nowa i rzadziej zmyśla. Rzadziej nie znaczy nigdy: RAG ogranicza halucynacje, ale ich nie eliminuje, więc dobre systemy pokazują źródła i potrafią powiedzieć "nie wiem".

Dlaczego model językowy bez RAG zgaduje?

Bo zna tylko to, co zobaczył podczas treningu. Duży model językowy (LLM, Large Language Model) uczy się rozumieć i generować język, analizując ogromne ilości tekstu: dokumentów, artykułów, książek i rozmów. Uczy się wzorców słów, zdań i kontekstu, dzięki czemu brzmi naturalnie niemal na każdy temat.

Taki trening jest bardzo drogi. Według Stanford AI Index szacowany koszt mocy obliczeniowej potrzebnej do wytrenowania GPT-4 wyniósł około 78 mln USD, a Gemini Ultra około 191 mln USD (Stanford HAI, AI Index 2024). Nikt nie będzie powtarzał go przy każdej zmianie cennika czy procedury w Twojej firmie.

Efekt: wiedza modelu jest zamrożona w konkretnym momencie i nie obejmuje danych, których model nigdy nie widział, takich jak umowy, procedury czy stany magazynowe Twojej firmy. To jak student zdający egzamin wyłącznie z pamięci: odpowie tylko na podstawie tego, czego nauczył się kilka tygodni wcześniej, bez możliwości sprawdzenia faktów. Model wytrenowany na początku 2024 r. nie wie, co wydarzyło się pod koniec 2025 r. A gdy czegoś nie wie, często i tak odpowiada, pewnym tonem. To właśnie halucynacja: odpowiedź brzmiąca wiarygodnie, ale zmyślona.

Jak RAG zmienia zasady gry?

RAG zamienia egzamin z pamięci w egzamin z otwartą książką. Zamiast polegać wyłącznie na tym, czego nauczył się w treningu, model najpierw sprawdza aktualne, zweryfikowane źródła i na nich buduje odpowiedź. Pojęcie i pierwszą architekturę opisał w 2020 r. zespół Facebook AI Research, łącząc wiedzę zapisaną w modelu z zewnętrznym indeksem dokumentów przeszukiwanym przez osobny model wyszukujący (Lewis i in., 2020).

Główne korzyści:

  • Mniej halucynacji. Model opiera odpowiedź na pobranej treści, zamiast zgadywać z mglistych wspomnień z treningu.
  • Przejrzystość. Odpowiedź może wskazać konkretny dokument i fragment, z którego pochodzi. Informację da się sprawdzić, co buduje zaufanie.
  • Prawo do "nie wiem". Jeśli w źródłach nie ma odpowiedzi, system może to uczciwie przyznać. "Nie mam tej informacji" jest dużo lepsze niż pewnie podana błędna odpowiedź.
  • Aktualność bez treningu. Zmieniasz dokument w bazie, a od następnego pytania odpowiedzi uwzględniają zmianę.

Jak działa RAG krok po kroku?

RAG działa w czterech krokach: jednym przygotowawczym i trzech wykonywanych przy każdym pytaniu.

Krok 0: Indeksowanie, czyli przygotowanie wiedzy. Dokumenty są dzielone na fragmenty, a każdy fragment zamieniany na embedding: wektor liczb opisujący jego znaczenie. Wektory trafiają do bazy wektorowej, która potrafi szybko znaleźć fragmenty o podobnym znaczeniu. Jakość tego kroku decyduje o wszystkim, co dzieje się dalej: źle odczytany skan albo tabela pocięta w połowie to fragment, którego model nie zrozumie. Dlatego RAG zaczyna się często od OCR, o którym piszemy w artykule czym jest nowoczesny OCR.

Krok 1: Retrieval, czyli wyszukanie. System przeszukuje źródła pod kątem informacji najbardziej związanych z pytaniem. Źródła mogą być publiczne (strony, artykuły, publiczne rejestry) albo wewnętrzne (bazy wiedzy, dokumenty, katalogi produktów, systemy firmy). Przykład: na pytanie "Kiedy dotrze moja paczka?" system sprawdza status tej konkretnej przesyłki w bazie przewoźnika.

Krok 2: Augmentation, czyli dołączenie kontekstu. Znalezione dane są dołączane do pytania. Model ma teraz i pytanie, i fakty z prawdziwych źródeł. Przykład: system ustala, że paczka jest w drodze z Warszawy, ostatni skan był 2 godziny temu, a planowana dostawa to 22 października, i dokleja te dane do pytania.

Krok 3: Generation, czyli odpowiedź. Dopiero teraz model tworzy odpowiedź, łącząc pytanie z pobranymi danymi, i może wskazać źródło. Przykład: "Twoja paczka jest w drodze z Warszawy i dotrze jutro, 22 października, do 20:00. [Źródło: baza przesyłek, aktualizacja 2 godziny temu]".

Czy RAG eliminuje halucynacje?

Nie. RAG wyraźnie je ogranicza, ale nie usuwa. Dobrze to widać w badaniu naukowców ze Stanforda, którzy sprawdzili komercyjne narzędzia do researchu prawniczego reklamowane jako wolne od halucynacji dzięki RAG. Narzędzia myliły się rzadziej niż ogólny czat GPT-4, ale wciąż halucynowały w 17-33% przypadków (Magesh i in., Journal of Empirical Legal Studies, 2025).

Skąd błędy? Wyszukiwanie może zwrócić niewłaściwy fragment, pominąć właściwy albo podać fragment bez kontekstu, a model może źle połączyć poprawne fakty. Co pomaga w praktyce:

  • Lepsze wyszukiwanie: połączenie wyszukiwania po znaczeniu (wektorowego) z wyszukiwaniem po słowach i reranking, czyli ponowne uszeregowanie wyników przez osobny model.
  • Przypisy do każdego twierdzenia, żeby użytkownik mógł sprawdzić źródło jednym kliknięciem.
  • Kontrola ugruntowania: automatyczne sprawdzenie, czy odpowiedź wynika z pobranych fragmentów, zanim trafi do użytkownika.
  • Zgoda na "nie wiem" zapisana w instrukcjach modelu i sprawdzana w testach.
  • Zestaw testowy pytań z oczekiwanymi odpowiedziami, uruchamiany po każdej zmianie.

RAG, fine-tuning czy długi kontekst: co wybrać?

RAG służy do dodania modelowi wiedzy, fine-tuning do zmiany jego zachowania. To częste nieporozumienie: firmy chcą "douczyć model swoich dokumentów", a zwykle potrzebują RAG.

KryteriumRAGFine-tuningDługi kontekst (wklejenie dokumentów do promptu)
Do czego służyOdpowiedzi na podstawie aktualnych dokumentówZmiana stylu, formatu, specjalizacja w zadaniuPraca na kilku znanych dokumentach naraz
Aktualizacja wiedzyZmiana dokumentu w baziePonowny treningWklejenie nowej wersji
Źródła i przypisyTak, naturalnieNieCzęściowo
Skala wiedzyBardzo duża (miliony fragmentów)OgraniczonaOgraniczona oknem kontekstu i kosztem
Kontrola dostępuNa poziomie dokumentu lub fragmentuBrak, wiedza jest w wagachRęczna
Typowy przykładBaza wiedzy, helpdesk, asystent prawnyModel piszący w stylu firmyAnaliza jednej umowy

Te podejścia można łączyć. Jak dostrajamy modele otwarte, pokazujemy na stronie Modele i fine-tuning.

Jak budujemy RAG w praktyce?

Naszą agentową bazę wiedzy wdrażamy w finansach, ubezpieczeniach i farmacji. Kilka decyzji z tego projektu dobrze pokazuje, gdzie w RAG naprawdę powstaje jakość:

  • Dokumenty: PDF-y, arkusze Excela i skany trafiają do jednego potoku. OCR czyta skany po polsku i angielsku, tabele zamieniamy na tekst z nagłówkami kolumn, wykresy opisuje model wizyjny, a każdy fragment dostaje prefiks z nazwą dokumentu i sekcji.
  • Polski język: wyszukiwanie wektorowe biegnie równolegle z polskim wyszukiwaniem pełnotekstowym, które sprowadza słowa do rdzeni, więc "dawki" i "dawka" to dla niego to samo słowo. Wyniki porządkuje reranker, a obie listy łączymy metodą RRF.
  • Agent zamiast jednego wyszukania: model sam decyduje, czy ma dość kontekstu, i w razie potrzeby dociąga cały rozdział albo sprawdza dokładną frazę. To podejście nazywa się agentic RAG, opisujemy je w artykule agentic RAG: od odpowiadania do działania.
  • Odpowiedź, którą można sprawdzić: każde twierdzenie ma przypis do fragmentu, a przed wysłaniem odpowiedź przechodzi kontrolę ugruntowania i detektor halucynacji.
  • Skala: baza zbudowana na publicznym rejestrze leków to ponad 2 mln fragmentów z 22 786 dokumentów.

Jak RAG chroni poufne dane?

Tylko wtedy, gdy zaprojektujesz to celowo. RAG sięga do dokumentów firmy, więc wyszukiwanie musi respektować uprawnienia: pracownik działu sprzedaży nie powinien dostać w odpowiedzi fragmentu umowy z zarządem tylko dlatego, że pasował do pytania. Filtry uprawnień stosuje się na etapie wyszukiwania, zanim fragment trafi do modelu. Więcej o uprawnieniach i RODO w systemach RAG piszemy w artykule bezpieczny RAG: uprawnienia i dostęp do danych.

Druga decyzja to miejsce przetwarzania. Nasza baza wiedzy działa on-premise, na własnych GPU i z lokalnymi modelami, więc dokumenty i pytania nie opuszczają firmy. Jak wygląda AI na własnej infrastrukturze, pokazujemy na stronie Infrastruktura AI.

Gdzie RAG ma największy sens?

Wszędzie tam, gdzie odpowiedź trzeba znaleźć w dokumentach albo danych, które się zmieniają. To dzięki RAG asystent banku może odpowiedzieć na pytanie o Twoje konto, asystent sklepu wie, co jest teraz na stanie, a firmowe AI przeszukuje procedury i polityki. Tak samo asystent medyczny sięga po aktualne wytyczne, narzędzie prawnicze po orzecznictwo, a helpdesk po status zamówienia.

Od czego zacząć:

  1. Wybierz jeden obszar wiedzy z jasnym właścicielem, na przykład procedury obsługi klienta albo dokumentację produktu.
  2. Spisz 30-50 prawdziwych pytań zadawanych dziś ludziom, razem z poprawnymi odpowiedziami. To Twój zestaw testowy.
  3. Uporządkuj dokumenty: usuń nieaktualne wersje, zadbaj o czytelne skany i strukturę.
  4. Ustal uprawnienia i miejsce przetwarzania przed pierwszym prototypem, nie po nim.
  5. Mierz jakość na zestawie testowym i dopiero potem udostępniaj szerzej.

Bez RAG chatbot daje wszystkim te same ogólne odpowiedzi z przestarzałej wiedzy. Z RAG staje się asystentem, który sięga po aktualne informacje dopasowane do Ciebie i Twojej sytuacji, i pokazuje, skąd je wziął. RAG zamienia zgadywanie w wiedzę, a to robi całą różnicę.

Źródła