Szybka odpowiedź

Agentic RAG to RAG (Retrieval-Augmented Generation), w którym między pytaniem a odpowiedzią działa agent AI: sam decyduje, gdzie i jak szukać, ocenia znalezione fragmenty, przeformułowuje zapytania i dociąga brakujący kontekst, zanim wygeneruje odpowiedź. Przegląd badań z 2025 r. opisuje go jako osadzenie autonomicznych agentów w potoku RAG z wykorzystaniem refleksji, planowania, użycia narzędzi i współpracy agentów (Singh i in., 2025). Różnica wobec klasycznego RAG: zamiast jednego wyszukiwania w stałej sekwencji jest pętla, która trwa, aż kontekst wystarczy.

Czym jest klasyczny RAG i gdzie się zatrzymuje?

RAG to technika, w której model językowy przed odpowiedzią wyszukuje fragmenty w bazie dokumentów i odpowiada na ich podstawie, zamiast polegać tylko na wiedzy z treningu. Pojęcie wprowadził w 2020 r. zespół Facebook AI Research z badaczami z UCL i NYU (Lewis i in., 2020). Jak działa w trzech krokach (wyszukanie, wzbogacenie, generowanie), opisujemy w artykule jak RAG czyni AI mądrzejszym.

Klasyczny RAG ma stałą ścieżkę: pytanie zamienia się w zapytanie, wyszukiwarka zwraca kilka najlepszych fragmentów, model generuje odpowiedź. To działa dobrze, gdy odpowiedź leży w jednym miejscu, a pytanie jest sformułowane podobnie jak dokument.

Zaczyna zawodzić, gdy:

  • pytanie jest wieloetapowe ("porównaj warunki z umowy A i B i sprawdź, która jest zgodna z nowym regulaminem"),
  • pierwsze wyszukiwanie zwraca za mało albo fragmenty wyrwane z kontekstu,
  • odpowiedź jest rozproszona po kilku dokumentach lub systemach,
  • pytanie jest nieprecyzyjne i trzeba je najpierw doprecyzować lub rozłożyć na części.

Klasyczny RAG nie wie, że znalazł za mało. Generuje odpowiedź z tego, co dostał, i tu rodzą się półprawdy.

Jak działa agentic RAG?

Agentic RAG zamienia wyszukiwanie z jednorazowego kroku w narzędzie, którego agent używa tyle razy, ile potrzeba. Agent, czyli model językowy działający w pętli (więcej w artykule czym jest agentic AI), przechodzi przez kolejne etapy:

  1. Analiza pytania. Agent ocenia, o co naprawdę chodzi, i rozkłada złożone pytanie na pytania cząstkowe.
  2. Plan wyszukiwania. Wybiera źródło i sposób: wyszukiwanie semantyczne, pełnotekstowe, zapytanie do bazy danych, czasem zewnętrzne API.
  3. Wyszukanie. Wywołuje narzędzie i dostaje fragmenty.
  4. Ocena. Sprawdza, czy fragmenty odpowiadają na pytanie, czy są kompletne i spójne.
  5. Korekta. Jeśli nie: przeformułowuje zapytanie, dociąga szerszy kontekst (cały rozdział zamiast akapitu), szuka w innym źródle albo sprawdza dokładną frazę.
  6. Odpowiedź z przypisami. Gdy kontekst wystarczy, generuje odpowiedź, w której każde twierdzenie wskazuje źródło.
  7. Kontrola. Przed wysłaniem odpowiedź przechodzi weryfikację ugruntowania w źródłach.

Badania nad tym podejściem trwają od kilku lat. Self-RAG uczy model samodzielnie decydować, kiedy szukać, i krytycznie oceniać znalezione fragmenty (Asai i in., 2023). Corrective RAG dodaje ocenę jakości wyszukiwania i akcje korygujące, gdy wyniki są słabe (Yan i in., 2024). Agentic RAG łączy te pomysły z ogólnymi wzorcami agentów.

RAG a agentic RAG: kluczowe różnice

CechaKlasyczny RAGAgentic RAG
PrzebiegStała sekwencja: pytanie, wyszukanie, odpowiedźPętla: plan, wyszukanie, ocena, korekta, odpowiedź
Liczba wyszukiwańJednoTyle, ile potrzeba (z limitem)
Kto decyduje o wyszukiwaniuKod potokuModel, w trakcie pracy
ŹródłaZwykle jedna baza wektorowaKilka narzędzi i źródeł
Pytania złożoneSłaboDobrze
Czas odpowiedzi i kosztNiższeWyższe
PrzewidywalnośćWysokaNiższa, wymaga śladu kroków
Najlepsze doFAQ, proste pytania o dokumentacjęAnaliza wielu dokumentów, pytania wieloetapowe, research

Prosta analogia: klasyczny RAG to kucharz, który gotuje dokładnie według przepisu. Agentic RAG to doświadczony kucharz, który próbuje w trakcie, dobiera składniki i zmienia technikę, gdy coś nie wychodzi.

Jak wygląda agentic RAG w praktyce: nasza baza wiedzy

Nasza agentowa baza wiedzy to działający przykład tego podejścia. Baza zbudowana na publicznym rejestrze leków obejmuje ponad 2 mln fragmentów z 22 786 dokumentów. Tak wygląda droga od dokumentu do odpowiedzi:

  • Dokumenty. PDF-y, arkusze Excela i skany trafiają do jednego potoku. OCR czyta skany po polsku i angielsku, tabele zamieniamy na tekst z nagłówkami kolumn, a wykresy opisuje model wizyjny. Każdy fragment dostaje prefiks z nazwą dokumentu i sekcji, zanim stanie się wektorem.
  • Wyszukiwanie hybrydowe. Dwa wyszukiwania biegną równolegle: wektorowe po znaczeniu i pełnotekstowe z polską odmianą, które sprowadza słowa do rdzeni, więc "dawki" i "dawka" to dla niego to samo. Reranker układa wyniki od najtrafniejszego, a obie listy łączymy metodą RRF (Reciprocal Rank Fusion).
  • Pętla agenta. Wyszukiwanie jest dla modelu narzędziem: sam decyduje, co wywołać i czy ma już dość kontekstu. W pytaniu o dawkowanie uznaje, że pierwsze fragmenty to za mało, dociąga cały rozdział o dawkowaniu, a potem dokładną frazą sprawdza w ulotce odstęp między dawkami.
  • Odpowiedź ze źródłami. Każde twierdzenie ma przypis do konkretnego fragmentu dokumentu. Przed wysłaniem odpowiedź przechodzi przez strażników: kontrolę ugruntowania w źródłach i detektor halucynacji.
  • Obserwowalność. Każdy krok agenta zapisuje się w warstwie obserwowalności, więc widać, skąd wzięła się odpowiedź.

Całość działa on-premise, na własnych GPU, więc dokumenty i pytania nie opuszczają firmy. To ważne w finansach, ubezpieczeniach i farmacji, gdzie wdrażamy takie bazy. Jak wygląda AI na własnej infrastrukturze, pokazujemy na stronie Infrastruktura AI.

Dwie obserwacje z tej pracy. Po pierwsze, agent nie naprawi złej jakości danych: jeśli skan jest nieczytelny albo tabela straciła nagłówki, żadna liczba iteracji tego nie odzyska. Po drugie, prefiks z nazwą dokumentu i sekcji przy każdym fragmencie to prosta technika, która wyraźnie pomaga wyszukiwaniu. Anthropic opisał podobne podejście (contextual retrieval): dodanie kontekstu do fragmentów w połączeniu z wyszukiwaniem pełnotekstowym zmniejszyło odsetek nieudanych wyszukiwań o 49%, a z rerankingiem o 67% w ich testach (Anthropic, 2024).

Jakie korzyści daje agentic RAG firmie?

Agentic RAG odpowiada na pytania, na które klasyczny RAG odpowiada źle albo wcale. W praktyce oznacza to:

  • Lepsze odpowiedzi na pytania złożone. Agent łączy informacje z kilku dokumentów i sprawdza szczegóły, zamiast generować odpowiedź z pierwszych trafień.
  • Mniej "pewnych siebie" błędów. Gdy kontekstu brakuje, agent szuka dalej albo przyznaje, że nie znalazł odpowiedzi.
  • Sprawdzalność. Przypisy do źródeł i ślad kroków pozwalają zweryfikować odpowiedź w kilka sekund, co buduje zaufanie użytkowników.
  • Łatwiejsze dokładanie źródeł. Nowe źródło to nowe narzędzie dla agenta. Narzędzia można podłączać przez otwarty standard MCP.

Zastosowania: wsparcie klienta oparte na dokumentacji, analiza umów i regulaminów, wyszukiwanie w dokumentacji technicznej i procedurach, przygotowanie raportów z wielu źródeł.

Kiedy wystarczy klasyczny RAG?

Gdy pytania są proste, odpowiedź leży w jednym miejscu, a liczy się czas odpowiedzi. FAQ, wyszukiwanie w regulaminie, pytania o godziny otwarcia czy procedurę zwrotu obsłuży klasyczny RAG szybciej i taniej.

Przy bardzo małej bazie wiedzy RAG może być w ogóle zbędny. Anthropic wskazuje, że bazę mniejszą niż 200 000 tokenów (około 500 stron) można po prostu w całości umieścić w prompcie (Anthropic, 2024).

SytuacjaRekomendacja
Kilkadziesiąt stron dokumentów, proste pytaniaCała baza w prompcie, bez RAG
Duża baza, pytania o jeden faktKlasyczny RAG z wyszukiwaniem hybrydowym
Duża baza, pytania złożone lub wieloetapoweAgentic RAG
Wiele systemów i akcje po odpowiedziAgentic RAG z narzędziami i zatwierdzaniem przez człowieka

Jakie są ryzyka i jak je ograniczyć?

Więcej autonomii to więcej punktów, w których coś może pójść nie tak. Najważniejsze ryzyka i odpowiedzi na nie:

  • Czas i koszt. Każda iteracja to kolejne wywołanie modelu. Ustaw limit kroków i budżet na pytanie.
  • Pętle bez końca. Agent może szukać w nieskończoność. Potrzebny jest warunek stopu i odpowiedź "nie znalazłem" jako poprawny wynik.
  • Uprawnienia. Agent nie może widzieć dokumentów, do których pytający nie ma dostępu. Kontrola uprawnień musi działać na poziomie wyszukiwania, nie tylko interfejsu. Piszemy o tym w artykule o bezpiecznym dostępie RAG do danych.
  • Wstrzyknięcie poleceń. Dokument w bazie może zawierać ukryte instrukcje. Agent powinien traktować treść dokumentów jako dane, nie polecenia.

Jak zacząć z agentic RAG?

Od solidnego klasycznego RAG i zestawu testowego, a pętlę agenta dodać tam, gdzie testy pokażą, że jedno wyszukiwanie nie wystarcza.

  1. Zbierz kilkadziesiąt realnych pytań z poprawnymi odpowiedziami i źródłami. To Twój punkt odniesienia.
  2. Zadbaj o przetwarzanie dokumentów: OCR, tabele, podział na fragmenty z kontekstem dokumentu i sekcji.
  3. Uruchom wyszukiwanie hybrydowe z rerankingiem. Dla polskich dokumentów wyszukiwanie pełnotekstowe musi radzić sobie z odmianą.
  4. Dodaj pętlę agenta z limitem kroków i zmierz, o ile poprawia odpowiedzi na trudnych pytaniach.
  5. Wymuś przypisy i kontrolę ugruntowania, a każdy krok loguj.

Agentic RAG to naturalny następny krok po RAG: system przestaje tylko wyszukiwać i zaczyna sprawdzać, czy to, co znalazł, wystarcza. Decyzje o ważnych sprawach nadal zostają przy człowieku, ale człowiek dostaje odpowiedź, którą może w kilka sekund zweryfikować.

Źródła