Szybka odpowiedź
Agentic RAG to RAG (Retrieval-Augmented Generation), w którym między pytaniem a odpowiedzią działa agent AI: sam decyduje, gdzie i jak szukać, ocenia znalezione fragmenty, przeformułowuje zapytania i dociąga brakujący kontekst, zanim wygeneruje odpowiedź. Przegląd badań z 2025 r. opisuje go jako osadzenie autonomicznych agentów w potoku RAG z wykorzystaniem refleksji, planowania, użycia narzędzi i współpracy agentów (Singh i in., 2025). Różnica wobec klasycznego RAG: zamiast jednego wyszukiwania w stałej sekwencji jest pętla, która trwa, aż kontekst wystarczy.
Czym jest klasyczny RAG i gdzie się zatrzymuje?
RAG to technika, w której model językowy przed odpowiedzią wyszukuje fragmenty w bazie dokumentów i odpowiada na ich podstawie, zamiast polegać tylko na wiedzy z treningu. Pojęcie wprowadził w 2020 r. zespół Facebook AI Research z badaczami z UCL i NYU (Lewis i in., 2020). Jak działa w trzech krokach (wyszukanie, wzbogacenie, generowanie), opisujemy w artykule jak RAG czyni AI mądrzejszym.
Klasyczny RAG ma stałą ścieżkę: pytanie zamienia się w zapytanie, wyszukiwarka zwraca kilka najlepszych fragmentów, model generuje odpowiedź. To działa dobrze, gdy odpowiedź leży w jednym miejscu, a pytanie jest sformułowane podobnie jak dokument.
Zaczyna zawodzić, gdy:
- pytanie jest wieloetapowe ("porównaj warunki z umowy A i B i sprawdź, która jest zgodna z nowym regulaminem"),
- pierwsze wyszukiwanie zwraca za mało albo fragmenty wyrwane z kontekstu,
- odpowiedź jest rozproszona po kilku dokumentach lub systemach,
- pytanie jest nieprecyzyjne i trzeba je najpierw doprecyzować lub rozłożyć na części.
Klasyczny RAG nie wie, że znalazł za mało. Generuje odpowiedź z tego, co dostał, i tu rodzą się półprawdy.
Jak działa agentic RAG?
Agentic RAG zamienia wyszukiwanie z jednorazowego kroku w narzędzie, którego agent używa tyle razy, ile potrzeba. Agent, czyli model językowy działający w pętli (więcej w artykule czym jest agentic AI), przechodzi przez kolejne etapy:
- Analiza pytania. Agent ocenia, o co naprawdę chodzi, i rozkłada złożone pytanie na pytania cząstkowe.
- Plan wyszukiwania. Wybiera źródło i sposób: wyszukiwanie semantyczne, pełnotekstowe, zapytanie do bazy danych, czasem zewnętrzne API.
- Wyszukanie. Wywołuje narzędzie i dostaje fragmenty.
- Ocena. Sprawdza, czy fragmenty odpowiadają na pytanie, czy są kompletne i spójne.
- Korekta. Jeśli nie: przeformułowuje zapytanie, dociąga szerszy kontekst (cały rozdział zamiast akapitu), szuka w innym źródle albo sprawdza dokładną frazę.
- Odpowiedź z przypisami. Gdy kontekst wystarczy, generuje odpowiedź, w której każde twierdzenie wskazuje źródło.
- Kontrola. Przed wysłaniem odpowiedź przechodzi weryfikację ugruntowania w źródłach.
Badania nad tym podejściem trwają od kilku lat. Self-RAG uczy model samodzielnie decydować, kiedy szukać, i krytycznie oceniać znalezione fragmenty (Asai i in., 2023). Corrective RAG dodaje ocenę jakości wyszukiwania i akcje korygujące, gdy wyniki są słabe (Yan i in., 2024). Agentic RAG łączy te pomysły z ogólnymi wzorcami agentów.
RAG a agentic RAG: kluczowe różnice
| Cecha | Klasyczny RAG | Agentic RAG |
|---|---|---|
| Przebieg | Stała sekwencja: pytanie, wyszukanie, odpowiedź | Pętla: plan, wyszukanie, ocena, korekta, odpowiedź |
| Liczba wyszukiwań | Jedno | Tyle, ile potrzeba (z limitem) |
| Kto decyduje o wyszukiwaniu | Kod potoku | Model, w trakcie pracy |
| Źródła | Zwykle jedna baza wektorowa | Kilka narzędzi i źródeł |
| Pytania złożone | Słabo | Dobrze |
| Czas odpowiedzi i koszt | Niższe | Wyższe |
| Przewidywalność | Wysoka | Niższa, wymaga śladu kroków |
| Najlepsze do | FAQ, proste pytania o dokumentację | Analiza wielu dokumentów, pytania wieloetapowe, research |
Prosta analogia: klasyczny RAG to kucharz, który gotuje dokładnie według przepisu. Agentic RAG to doświadczony kucharz, który próbuje w trakcie, dobiera składniki i zmienia technikę, gdy coś nie wychodzi.
Jak wygląda agentic RAG w praktyce: nasza baza wiedzy
Nasza agentowa baza wiedzy to działający przykład tego podejścia. Baza zbudowana na publicznym rejestrze leków obejmuje ponad 2 mln fragmentów z 22 786 dokumentów. Tak wygląda droga od dokumentu do odpowiedzi:
- Dokumenty. PDF-y, arkusze Excela i skany trafiają do jednego potoku. OCR czyta skany po polsku i angielsku, tabele zamieniamy na tekst z nagłówkami kolumn, a wykresy opisuje model wizyjny. Każdy fragment dostaje prefiks z nazwą dokumentu i sekcji, zanim stanie się wektorem.
- Wyszukiwanie hybrydowe. Dwa wyszukiwania biegną równolegle: wektorowe po znaczeniu i pełnotekstowe z polską odmianą, które sprowadza słowa do rdzeni, więc "dawki" i "dawka" to dla niego to samo. Reranker układa wyniki od najtrafniejszego, a obie listy łączymy metodą RRF (Reciprocal Rank Fusion).
- Pętla agenta. Wyszukiwanie jest dla modelu narzędziem: sam decyduje, co wywołać i czy ma już dość kontekstu. W pytaniu o dawkowanie uznaje, że pierwsze fragmenty to za mało, dociąga cały rozdział o dawkowaniu, a potem dokładną frazą sprawdza w ulotce odstęp między dawkami.
- Odpowiedź ze źródłami. Każde twierdzenie ma przypis do konkretnego fragmentu dokumentu. Przed wysłaniem odpowiedź przechodzi przez strażników: kontrolę ugruntowania w źródłach i detektor halucynacji.
- Obserwowalność. Każdy krok agenta zapisuje się w warstwie obserwowalności, więc widać, skąd wzięła się odpowiedź.
Całość działa on-premise, na własnych GPU, więc dokumenty i pytania nie opuszczają firmy. To ważne w finansach, ubezpieczeniach i farmacji, gdzie wdrażamy takie bazy. Jak wygląda AI na własnej infrastrukturze, pokazujemy na stronie Infrastruktura AI.
Dwie obserwacje z tej pracy. Po pierwsze, agent nie naprawi złej jakości danych: jeśli skan jest nieczytelny albo tabela straciła nagłówki, żadna liczba iteracji tego nie odzyska. Po drugie, prefiks z nazwą dokumentu i sekcji przy każdym fragmencie to prosta technika, która wyraźnie pomaga wyszukiwaniu. Anthropic opisał podobne podejście (contextual retrieval): dodanie kontekstu do fragmentów w połączeniu z wyszukiwaniem pełnotekstowym zmniejszyło odsetek nieudanych wyszukiwań o 49%, a z rerankingiem o 67% w ich testach (Anthropic, 2024).
Jakie korzyści daje agentic RAG firmie?
Agentic RAG odpowiada na pytania, na które klasyczny RAG odpowiada źle albo wcale. W praktyce oznacza to:
- Lepsze odpowiedzi na pytania złożone. Agent łączy informacje z kilku dokumentów i sprawdza szczegóły, zamiast generować odpowiedź z pierwszych trafień.
- Mniej "pewnych siebie" błędów. Gdy kontekstu brakuje, agent szuka dalej albo przyznaje, że nie znalazł odpowiedzi.
- Sprawdzalność. Przypisy do źródeł i ślad kroków pozwalają zweryfikować odpowiedź w kilka sekund, co buduje zaufanie użytkowników.
- Łatwiejsze dokładanie źródeł. Nowe źródło to nowe narzędzie dla agenta. Narzędzia można podłączać przez otwarty standard MCP.
Zastosowania: wsparcie klienta oparte na dokumentacji, analiza umów i regulaminów, wyszukiwanie w dokumentacji technicznej i procedurach, przygotowanie raportów z wielu źródeł.
Kiedy wystarczy klasyczny RAG?
Gdy pytania są proste, odpowiedź leży w jednym miejscu, a liczy się czas odpowiedzi. FAQ, wyszukiwanie w regulaminie, pytania o godziny otwarcia czy procedurę zwrotu obsłuży klasyczny RAG szybciej i taniej.
Przy bardzo małej bazie wiedzy RAG może być w ogóle zbędny. Anthropic wskazuje, że bazę mniejszą niż 200 000 tokenów (około 500 stron) można po prostu w całości umieścić w prompcie (Anthropic, 2024).
| Sytuacja | Rekomendacja |
|---|---|
| Kilkadziesiąt stron dokumentów, proste pytania | Cała baza w prompcie, bez RAG |
| Duża baza, pytania o jeden fakt | Klasyczny RAG z wyszukiwaniem hybrydowym |
| Duża baza, pytania złożone lub wieloetapowe | Agentic RAG |
| Wiele systemów i akcje po odpowiedzi | Agentic RAG z narzędziami i zatwierdzaniem przez człowieka |
Jakie są ryzyka i jak je ograniczyć?
Więcej autonomii to więcej punktów, w których coś może pójść nie tak. Najważniejsze ryzyka i odpowiedzi na nie:
- Czas i koszt. Każda iteracja to kolejne wywołanie modelu. Ustaw limit kroków i budżet na pytanie.
- Pętle bez końca. Agent może szukać w nieskończoność. Potrzebny jest warunek stopu i odpowiedź "nie znalazłem" jako poprawny wynik.
- Uprawnienia. Agent nie może widzieć dokumentów, do których pytający nie ma dostępu. Kontrola uprawnień musi działać na poziomie wyszukiwania, nie tylko interfejsu. Piszemy o tym w artykule o bezpiecznym dostępie RAG do danych.
- Wstrzyknięcie poleceń. Dokument w bazie może zawierać ukryte instrukcje. Agent powinien traktować treść dokumentów jako dane, nie polecenia.
Jak zacząć z agentic RAG?
Od solidnego klasycznego RAG i zestawu testowego, a pętlę agenta dodać tam, gdzie testy pokażą, że jedno wyszukiwanie nie wystarcza.
- Zbierz kilkadziesiąt realnych pytań z poprawnymi odpowiedziami i źródłami. To Twój punkt odniesienia.
- Zadbaj o przetwarzanie dokumentów: OCR, tabele, podział na fragmenty z kontekstem dokumentu i sekcji.
- Uruchom wyszukiwanie hybrydowe z rerankingiem. Dla polskich dokumentów wyszukiwanie pełnotekstowe musi radzić sobie z odmianą.
- Dodaj pętlę agenta z limitem kroków i zmierz, o ile poprawia odpowiedzi na trudnych pytaniach.
- Wymuś przypisy i kontrolę ugruntowania, a każdy krok loguj.
Agentic RAG to naturalny następny krok po RAG: system przestaje tylko wyszukiwać i zaczyna sprawdzać, czy to, co znalazł, wystarcza. Decyzje o ważnych sprawach nadal zostają przy człowieku, ale człowiek dostaje odpowiedź, którą może w kilka sekund zweryfikować.
Źródła
- Singh i in.: Agentic Retrieval-Augmented Generation: A Survey on Agentic RAG (arXiv, 2025)
- Lewis i in.: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (arXiv, 2020)
- Asai i in.: Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection (arXiv, 2023)
- Yan i in.: Corrective Retrieval Augmented Generation (arXiv, 2024)
- Anthropic: Introducing Contextual Retrieval (2024)