Baza wiedzy, która pokazuje paragraf.
Umowy, pisma i ustawy kancelarii zamienione w mapę znaczeń. Pytasz zwykłym zdaniem, dostajesz odpowiedź z cytatem, a dokumenty nie opuszczają Twojej serwerowni.

Baza wiedzy, która pokazuje paragraf.
Umowy, pisma i ustawy kancelarii zamienione w mapę znaczeń. Pytasz zwykłym zdaniem, dostajesz odpowiedź z cytatem, a dokumenty nie opuszczają Twojej serwerowni.
modele: Qwen · Gemma · GLM · Mistral
Siedem etapów od skanu do cytatu
Dokument wchodzi
Umowa przychodzi jako skan, pismo jako DOCX, ustawa jako PDF. OCR zamienia obraz w tekst, potem sprzątamy stopki, numery stron i dzielenie wyrazów. Na końcu dokument dzieli się na fragmenty według własnej struktury (paragraf, ustęp, artykuł), a każdy dostaje pełną ścieżkę nagłówków i jedno zdanie kontekstu.
- Przyjęcie i odcisk pliku
- OCR: polski i angielski
- Czyszczenie tekstu
- Struktura: § › ust.
- Fragmenty z kontekstem

Fragmenty i znaczenie
Model embeddingów czyta fragment razem z nagłówkami i zamienia go w wektor: kilka tysięcy liczb opisujących sens. Fragmenty o podobnym znaczeniu lądują obok siebie, nawet jeśli używają innych słów. Każdy punkt dostaje metryczkę (dokument, artykuł, dział, wersja) i trafia też do indeksu pełnotekstowego z polską odmianą wyrazów.
- Fragment → wektor
- Mapa znaczeń
- Sąsiedzi
- Metryczka i indeks pełnotekstowy

Szukanie jak prawnik
Prawnik szuka na dwa sposoby naraz: po sensie i po dokładnym brzmieniu przepisu. System też. Pytanie jest najpierw klasyfikowane, potem równolegle przeszukujemy wektory i pełny tekst, łączymy obie listy, a model rerankingowy czyta każdą parę pytanie–fragment i ustala ostateczną kolejność. Gdy nic nie przekracza progu, odpowiedź brzmi „nie wiem”.
- Analiza pytania
- Wektory + pełny tekst
- Łączenie list (RRF)
- Reranking
- Werdykt

Odpowiedź z dowodem
Fragmenty trafiają do kontekstu modelu w kolejności ważności, do budżetu tokenów ustalonego dla typu pytania; część miejsca zostaje na odpowiedź. Model pisze tylko z tego, co dostał, i przy każdym zdaniu wskazuje źródło. Klik w cytat otwiera dokument i podświetla zdanie, z którego pochodzi.
- Budżet kontekstu
- Odpowiedź z cytatami
- Podgląd źródła
- Sprawdzenie ugruntowania

Wiedza, która się zmienia
Nowa wersja ustawy nie oznacza przebudowy całej bazy. System rozpoznaje dokument po stałym identyfikatorze, porównuje jego fragmenty z poprzednią wersją i przelicza tylko te, które się zmieniły. Nowa wersja staje się obowiązująca dopiero po pełnym przetworzeniu, stara zostaje w historii.
- Nowa wersja
- Porównanie fragmentów
- Przeliczenie zmian
- Publikacja

Kto co widzi
Każdy fragment ma w metryczce dział, do którego należy. Filtr działa w samym indeksie, zanim cokolwiek zostanie wyszukane, więc akta innego działu nie trafią ani do rankingu, ani do kontekstu modelu. Każde pytanie zostaje w dzienniku audytu: kto pytał, kiedy i na jakich źródłach oparto odpowiedź.
- Kto pyta
- Filtr w indeksie
- Szukanie w dozwolonych
- Odpowiedź i audyt

U Ciebie, nie w chmurze
Tajemnica zawodowa nie znosi kompromisów. Cały łańcuch (OCR, indeksy, model embeddingów, reranker i model językowy) działa na serwerze w sieci kancelarii, na GPU NVIDIA Blackwell. Pytania, dokumenty i odpowiedzi nie wychodzą na zewnątrz, a dziennik audytu zostaje u Ciebie.
- Pytanie w sieci kancelarii
- Model na własnym GPU
- Granica sieci
- Audyt i maskowanie

Pokażemy to na Twoich dokumentach.
Bierzemy próbkę akt, zanonimizowaną albo przetwarzaną u Ciebie na miejscu. Budujemy bazę, a Twoi prawnicy zadają jej prawdziwe pytania i sprawdzają, czy każda odpowiedź trafia w źródło.
- 01 · próbkaKilkaset dokumentów z jednego działu: skany, DOCX, ustawy.
- 02 · pytaniaLista pytań, które prawnicy zadają naprawdę, razem z oczekiwanym źródłem.
- 03 · wynikRaport: gdzie odpowiedź trafia w źródło, gdzie mówi „nie wiem” i dlaczego.
To nie porada prawna. Kancelaria, sprawy, umowy, notatki i nazwiska są fikcyjne (dane przykładowe). Przepisy ustaw cytowane poglądowo, bez weryfikacji aktualnego stanu prawnego. Liczby tokenów, wyniki podobieństwa i oceny rerankera w scenach ilustrują mechanikę.