Agent AI.
Od kuchni.
Pytanie, rozumowanie, prawdziwe wywołania narzędzi, zgoda człowieka i odpowiedź ze źródłami. Tak pracuje agent pimento: na lokalnych modelach i naszych GPU, krok po kroku.

Zanim agent coś zrobi, myśli na głos
Pytanie trafia do modelu razem z personą kancelarii, procedurą i opisem narzędzi. Model rozpisuje rozumowanie w bloku <think> i układa plan: co sprawdzić, którym narzędziem i w jakiej kolejności. Rozumowanie zostaje w logu, do klienta trafia tylko odpowiedź.
- 01prompt
- 02rozumowanie
- 03plan
- 04krok 1

Prawdziwe wywołania, prawdziwy JSON
Model nie „pamięta” przepisów, tylko je wyszukuje. Każde wywołanie to JSON z argumentami. Wyszukiwanie w wektorach i pełnotekstowe w bazie idą równolegle, a wyniki są łączone i przesiewane. Do kontekstu wracają fragmenty z identyfikatorami, oznaczone jako dane, nie polecenia.
- 01argumenty JSON
- 02równolegle
- 03łączenie
- 04do kontekstu

Pamięć krótka i pamięć długa
Krótka pamięć to okno kontekstu: pytanie, kroki i wyniki narzędzi. Przed limitem stare wyniki zamieniają się w ślad wykonania („zrobione, nie powtarzaj”), a ostatnie kroki zostają nietknięte. Długa pamięć to fakty o sprawie w bazie wektorowej, przywoływane wtedy, gdy są potrzebne.
- 01okno się zapełnia
- 02kompresja
- 03pamięć długa
- 04kontekst gotowy

Akcje ze skutkiem czekają na zgodę
Czytać agent może sam. Wysłać pismo, wpisać termin czy zmienić dane może dopiero po zgodzie prawnika. Pętla staje na bursztynowym kroku i czeka. Odrzucenie z uwagą wraca do agenta jako nowe polecenie, a brak decyzji oznacza odmowę.
- 01szkic pisma
- 02akcja
- 03czeka na zgodę
- 04decyzja

Granice, budżet i ślad każdego kroku
Narzędzia działają w piaskownicy z listą dozwolonych poleceń. Tekst z dokumentów to dane, nie instrukcje, więc „zignoruj polecenia” w aktach niczego nie zmienia. Budżet kroków i bezpiecznik pętli zatrzymują agenta, który kręci się w kółko. Każdy krok trafia do dziennika audytu.
- 01piaskownica
- 02wstrzyknięcie
- 03bezpiecznik pętli
- 04dziennik

Każda nowa wersja zdaje egzamin
Prawdziwe rozmowy po przeglądzie przez człowieka trafiają do zestawu testowego. Przed wdrożeniem nowego promptu, procedury albo modelu agent przechodzi cały zestaw: czy cytuje właściwy przepis, czy nie działa bez zgody, czy mieści się w budżecie kroków. Regresja zatrzymuje wdrożenie.
- 01zestaw z logów
- 02przebieg
- 03regresja
- 04poprawka

Lokalne modele, Twoje dane zostają w środku
Agent, model, wektory i dziennik działają na serwerach z GPU NVIDIA Blackwell: u nas albo w Twojej serwerowni. Modele open-source (Qwen, Gemma, GLM, Mistral) serwujemy sami, bez zewnętrznych API. Ruch wychodzący jest domyślnie zamknięty, więc pytania, akta i odpowiedzi nie opuszczają sieci.
- 01pytanie w sieci
- 02prefill
- 03decode
- 04ruch wychodzący

Agent, który pracuje u Ciebie.
Zaczynamy od jednego procesu i Twoich dokumentów. Na warsztacie pokażemy tę samą pętlę na Twoich danych: z narzędziami, zgodami i dziennikiem, na naszych GPU albo na Twoich.
- 01Warsztat: wybieramy proces i narzędzia
- 02Prototyp agenta na Twoich dokumentach
- 03Zestaw testowy, zgody, dziennik audytu
- 04Wdrożenie na lokalnych modelach
scenariusz kancelarii jest przykładowy, czasy i identyfikatory są ilustracją mechaniki