Szybka odpowiedź
RAG (Retrieval-Augmented Generation, generowanie wspomagane wyszukiwaniem) to technika, w której model językowy przed odpowiedzią wyszukuje informacje w aktualnych źródłach, na przykład dokumentach i bazach Twojej firmy, i odpowiada na ich podstawie, często z przypisem. Dzięki temu AI może korzystać z bieżących i prywatnych danych bez trenowania modelu od nowa i rzadziej zmyśla. Rzadziej nie znaczy nigdy: RAG ogranicza halucynacje, ale ich nie eliminuje, więc dobre systemy pokazują źródła i potrafią powiedzieć "nie wiem".
Dlaczego model językowy bez RAG zgaduje?
Bo zna tylko to, co zobaczył podczas treningu. Duży model językowy (LLM, Large Language Model) uczy się rozumieć i generować język, analizując ogromne ilości tekstu: dokumentów, artykułów, książek i rozmów. Uczy się wzorców słów, zdań i kontekstu, dzięki czemu brzmi naturalnie niemal na każdy temat.
Taki trening jest bardzo drogi. Według Stanford AI Index szacowany koszt mocy obliczeniowej potrzebnej do wytrenowania GPT-4 wyniósł około 78 mln USD, a Gemini Ultra około 191 mln USD (Stanford HAI, AI Index 2024). Nikt nie będzie powtarzał go przy każdej zmianie cennika czy procedury w Twojej firmie.
Efekt: wiedza modelu jest zamrożona w konkretnym momencie i nie obejmuje danych, których model nigdy nie widział, takich jak umowy, procedury czy stany magazynowe Twojej firmy. To jak student zdający egzamin wyłącznie z pamięci: odpowie tylko na podstawie tego, czego nauczył się kilka tygodni wcześniej, bez możliwości sprawdzenia faktów. Model wytrenowany na początku 2024 r. nie wie, co wydarzyło się pod koniec 2025 r. A gdy czegoś nie wie, często i tak odpowiada, pewnym tonem. To właśnie halucynacja: odpowiedź brzmiąca wiarygodnie, ale zmyślona.
Jak RAG zmienia zasady gry?
RAG zamienia egzamin z pamięci w egzamin z otwartą książką. Zamiast polegać wyłącznie na tym, czego nauczył się w treningu, model najpierw sprawdza aktualne, zweryfikowane źródła i na nich buduje odpowiedź. Pojęcie i pierwszą architekturę opisał w 2020 r. zespół Facebook AI Research, łącząc wiedzę zapisaną w modelu z zewnętrznym indeksem dokumentów przeszukiwanym przez osobny model wyszukujący (Lewis i in., 2020).
Główne korzyści:
- Mniej halucynacji. Model opiera odpowiedź na pobranej treści, zamiast zgadywać z mglistych wspomnień z treningu.
- Przejrzystość. Odpowiedź może wskazać konkretny dokument i fragment, z którego pochodzi. Informację da się sprawdzić, co buduje zaufanie.
- Prawo do "nie wiem". Jeśli w źródłach nie ma odpowiedzi, system może to uczciwie przyznać. "Nie mam tej informacji" jest dużo lepsze niż pewnie podana błędna odpowiedź.
- Aktualność bez treningu. Zmieniasz dokument w bazie, a od następnego pytania odpowiedzi uwzględniają zmianę.
Jak działa RAG krok po kroku?
RAG działa w czterech krokach: jednym przygotowawczym i trzech wykonywanych przy każdym pytaniu.
Krok 0: Indeksowanie, czyli przygotowanie wiedzy. Dokumenty są dzielone na fragmenty, a każdy fragment zamieniany na embedding: wektor liczb opisujący jego znaczenie. Wektory trafiają do bazy wektorowej, która potrafi szybko znaleźć fragmenty o podobnym znaczeniu. Jakość tego kroku decyduje o wszystkim, co dzieje się dalej: źle odczytany skan albo tabela pocięta w połowie to fragment, którego model nie zrozumie. Dlatego RAG zaczyna się często od OCR, o którym piszemy w artykule czym jest nowoczesny OCR.
Krok 1: Retrieval, czyli wyszukanie. System przeszukuje źródła pod kątem informacji najbardziej związanych z pytaniem. Źródła mogą być publiczne (strony, artykuły, publiczne rejestry) albo wewnętrzne (bazy wiedzy, dokumenty, katalogi produktów, systemy firmy). Przykład: na pytanie "Kiedy dotrze moja paczka?" system sprawdza status tej konkretnej przesyłki w bazie przewoźnika.
Krok 2: Augmentation, czyli dołączenie kontekstu. Znalezione dane są dołączane do pytania. Model ma teraz i pytanie, i fakty z prawdziwych źródeł. Przykład: system ustala, że paczka jest w drodze z Warszawy, ostatni skan był 2 godziny temu, a planowana dostawa to 22 października, i dokleja te dane do pytania.
Krok 3: Generation, czyli odpowiedź. Dopiero teraz model tworzy odpowiedź, łącząc pytanie z pobranymi danymi, i może wskazać źródło. Przykład: "Twoja paczka jest w drodze z Warszawy i dotrze jutro, 22 października, do 20:00. [Źródło: baza przesyłek, aktualizacja 2 godziny temu]".
Czy RAG eliminuje halucynacje?
Nie. RAG wyraźnie je ogranicza, ale nie usuwa. Dobrze to widać w badaniu naukowców ze Stanforda, którzy sprawdzili komercyjne narzędzia do researchu prawniczego reklamowane jako wolne od halucynacji dzięki RAG. Narzędzia myliły się rzadziej niż ogólny czat GPT-4, ale wciąż halucynowały w 17-33% przypadków (Magesh i in., Journal of Empirical Legal Studies, 2025).
Skąd błędy? Wyszukiwanie może zwrócić niewłaściwy fragment, pominąć właściwy albo podać fragment bez kontekstu, a model może źle połączyć poprawne fakty. Co pomaga w praktyce:
- Lepsze wyszukiwanie: połączenie wyszukiwania po znaczeniu (wektorowego) z wyszukiwaniem po słowach i reranking, czyli ponowne uszeregowanie wyników przez osobny model.
- Przypisy do każdego twierdzenia, żeby użytkownik mógł sprawdzić źródło jednym kliknięciem.
- Kontrola ugruntowania: automatyczne sprawdzenie, czy odpowiedź wynika z pobranych fragmentów, zanim trafi do użytkownika.
- Zgoda na "nie wiem" zapisana w instrukcjach modelu i sprawdzana w testach.
- Zestaw testowy pytań z oczekiwanymi odpowiedziami, uruchamiany po każdej zmianie.
RAG, fine-tuning czy długi kontekst: co wybrać?
RAG służy do dodania modelowi wiedzy, fine-tuning do zmiany jego zachowania. To częste nieporozumienie: firmy chcą "douczyć model swoich dokumentów", a zwykle potrzebują RAG.
| Kryterium | RAG | Fine-tuning | Długi kontekst (wklejenie dokumentów do promptu) |
|---|---|---|---|
| Do czego służy | Odpowiedzi na podstawie aktualnych dokumentów | Zmiana stylu, formatu, specjalizacja w zadaniu | Praca na kilku znanych dokumentach naraz |
| Aktualizacja wiedzy | Zmiana dokumentu w bazie | Ponowny trening | Wklejenie nowej wersji |
| Źródła i przypisy | Tak, naturalnie | Nie | Częściowo |
| Skala wiedzy | Bardzo duża (miliony fragmentów) | Ograniczona | Ograniczona oknem kontekstu i kosztem |
| Kontrola dostępu | Na poziomie dokumentu lub fragmentu | Brak, wiedza jest w wagach | Ręczna |
| Typowy przykład | Baza wiedzy, helpdesk, asystent prawny | Model piszący w stylu firmy | Analiza jednej umowy |
Te podejścia można łączyć. Jak dostrajamy modele otwarte, pokazujemy na stronie Modele i fine-tuning.
Jak budujemy RAG w praktyce?
Naszą agentową bazę wiedzy wdrażamy w finansach, ubezpieczeniach i farmacji. Kilka decyzji z tego projektu dobrze pokazuje, gdzie w RAG naprawdę powstaje jakość:
- Dokumenty: PDF-y, arkusze Excela i skany trafiają do jednego potoku. OCR czyta skany po polsku i angielsku, tabele zamieniamy na tekst z nagłówkami kolumn, wykresy opisuje model wizyjny, a każdy fragment dostaje prefiks z nazwą dokumentu i sekcji.
- Polski język: wyszukiwanie wektorowe biegnie równolegle z polskim wyszukiwaniem pełnotekstowym, które sprowadza słowa do rdzeni, więc "dawki" i "dawka" to dla niego to samo słowo. Wyniki porządkuje reranker, a obie listy łączymy metodą RRF.
- Agent zamiast jednego wyszukania: model sam decyduje, czy ma dość kontekstu, i w razie potrzeby dociąga cały rozdział albo sprawdza dokładną frazę. To podejście nazywa się agentic RAG, opisujemy je w artykule agentic RAG: od odpowiadania do działania.
- Odpowiedź, którą można sprawdzić: każde twierdzenie ma przypis do fragmentu, a przed wysłaniem odpowiedź przechodzi kontrolę ugruntowania i detektor halucynacji.
- Skala: baza zbudowana na publicznym rejestrze leków to ponad 2 mln fragmentów z 22 786 dokumentów.
Jak RAG chroni poufne dane?
Tylko wtedy, gdy zaprojektujesz to celowo. RAG sięga do dokumentów firmy, więc wyszukiwanie musi respektować uprawnienia: pracownik działu sprzedaży nie powinien dostać w odpowiedzi fragmentu umowy z zarządem tylko dlatego, że pasował do pytania. Filtry uprawnień stosuje się na etapie wyszukiwania, zanim fragment trafi do modelu. Więcej o uprawnieniach i RODO w systemach RAG piszemy w artykule bezpieczny RAG: uprawnienia i dostęp do danych.
Druga decyzja to miejsce przetwarzania. Nasza baza wiedzy działa on-premise, na własnych GPU i z lokalnymi modelami, więc dokumenty i pytania nie opuszczają firmy. Jak wygląda AI na własnej infrastrukturze, pokazujemy na stronie Infrastruktura AI.
Gdzie RAG ma największy sens?
Wszędzie tam, gdzie odpowiedź trzeba znaleźć w dokumentach albo danych, które się zmieniają. To dzięki RAG asystent banku może odpowiedzieć na pytanie o Twoje konto, asystent sklepu wie, co jest teraz na stanie, a firmowe AI przeszukuje procedury i polityki. Tak samo asystent medyczny sięga po aktualne wytyczne, narzędzie prawnicze po orzecznictwo, a helpdesk po status zamówienia.
Od czego zacząć:
- Wybierz jeden obszar wiedzy z jasnym właścicielem, na przykład procedury obsługi klienta albo dokumentację produktu.
- Spisz 30-50 prawdziwych pytań zadawanych dziś ludziom, razem z poprawnymi odpowiedziami. To Twój zestaw testowy.
- Uporządkuj dokumenty: usuń nieaktualne wersje, zadbaj o czytelne skany i strukturę.
- Ustal uprawnienia i miejsce przetwarzania przed pierwszym prototypem, nie po nim.
- Mierz jakość na zestawie testowym i dopiero potem udostępniaj szerzej.
Bez RAG chatbot daje wszystkim te same ogólne odpowiedzi z przestarzałej wiedzy. Z RAG staje się asystentem, który sięga po aktualne informacje dopasowane do Ciebie i Twojej sytuacji, i pokazuje, skąd je wziął. RAG zamienia zgadywanie w wiedzę, a to robi całą różnicę.
Źródła
- Lewis P. i in.: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, arXiv 2020
- Magesh V. i in.: Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools, Journal of Empirical Legal Studies, 2025 (preprint arXiv)
- Stanford HAI: AI Index: State of AI in 13 Charts (2024)