Szybka odpowiedź

Dla większości firm tak: model zamknięty, czyli model AI udostępniany przez dostawcę przez API lub aplikację, bez publicznych wag, to najszybszy sposób, żeby zacząć korzystać z AI. Nie potrzebujesz serwerów GPU ani zespołu ML, płacisz za użycie, a masz dostęp do najmocniejszych modeli na rynku. Ograniczenia pojawiają się później: gdy dane nie mogą opuścić firmy, gdy model nie zna Twoich dokumentów (wtedy pomaga RAG) albo gdy przy dużej skali rachunek za tokeny przewyższa koszt własnej infrastruktury.

Czym jest model zamknięty?

Model zamknięty (ang. closed-source, proprietary) to model, którego wagi, czyli wyuczone parametry, zna tylko dostawca. Model działa na jego serwerach, a Ty wysyłasz zapytanie przez API (interfejs, przez który Twoja aplikacja rozmawia z modelem) i dostajesz odpowiedź.

Przeciwieństwem jest model otwarty (ang. open-weight): wagi można pobrać, uruchomić na własnym sprzęcie i dostroić. Jak dostrajamy modele otwarte, pokazujemy na stronie Modele i fine-tuning.

Dobrze działa analogia z biurem. Nie budujesz biurowca, zanim nie sprawdzisz, czy biznes działa. Najpierw wynajmujesz przestrzeń, a o budowie myślisz, gdy znasz swoje potrzeby i skalę.

KryteriumModel zamknięty przez APIModel otwarty na własnej infrastrukturzeHybryda (API + RAG lub API + model lokalny)
Czas startuDniTygodnie do miesięcyTygodnie
Koszt początkowyBliski zeraSprzęt GPU lub wynajem, wdrożenieUmiarkowany: wyszukiwanie, integracja
Koszt przy dużej skaliRośnie liniowo z liczbą tokenówGłównie stały (sprzęt, energia, utrzymanie)Zależy od podziału ruchu
Jakość w zadaniach ogólnychZwykle najwyższa dostępnaDobra, zależy od modelu i sprzętuNajwyższa tam, gdzie trzeba
Kontrola nad danymiZależna od umowy i regionu dostawcyPełnaWrażliwe dane mogą zostać lokalnie
Kontrola nad wersją modeluDostawca wycofuje stare modelePełnaCzęściowa
Wymagane kompetencjeIntegracja, prompty, ewaluacjaDodatkowo MLOps i utrzymanie GPUIntegracja i wyszukiwanie

Kto dostarcza modele zamknięte w 2026 r.?

Rynek zdominowały trzy rodziny modeli: GPT (OpenAI), Claude (Anthropic) i Gemini (Google). Każdy dostawca oferuje kilka poziomów: model flagowy do najtrudniejszych zadań, model zbalansowany do codziennej pracy oraz mały i szybki model do prostych, masowych zadań. Część z tych modeli jest dostępna także przez chmury publiczne: modele OpenAI w Microsoft Azure, Gemini w Google Cloud, a Claude m.in. w Amazon Bedrock, Google Cloud i Microsoft Foundry (Anthropic). To ułatwia start firmom, które mają już umowę z jedną z tych chmur.

Nie podajemy tu nazw konkretnych wersji ani cen, bo zmieniają się co kilka miesięcy. Aktualne stawki znajdziesz w cennikach: OpenAI, Anthropic i Google Gemini.

Wniosek praktyczny: projektuj rozwiązanie tak, żeby model dało się wymienić. Dostawcy regularnie wycofują starsze wersje i publikują harmonogramy ich wyłączania (OpenAI, Anthropic). Własny zestaw testowy i cienka warstwa pośrednia między aplikacją a API sprawiają, że zmiana modelu to dzień pracy, a nie projekt.

Za co właściwie płacisz?

Za tokeny. Token to fragment tekstu, często kawałek słowa, na które model dzieli wejście i wyjście. Płacisz osobno za tokeny wysłane do modelu (pytanie, instrukcje, dokumenty) i za tokeny wygenerowane (odpowiedź), przy czym wyjście jest zwykle kilkukrotnie droższe od wejścia (w aktualnych cennikach OpenAI i Anthropic ok. pięciokrotnie).

Ważna rzecz dla polskich firm: polszczyzna "kosztuje" więcej tokenów. Zmierzyliśmy to na trzech naszych artykułach, które mają wersję polską i angielską o tej samej treści. Tokenizerem o200k_base z biblioteki tiktoken wersje polskie dały ok. 1,5 raza więcej tokenów niż angielskie (ok. 2,1 tokenu na słowo wobec ok. 1,3). Inne modele mają inne tokenizery, więc wynik będzie się różnił, ale kierunek jest ten sam: budżet liczony na podstawie angielskich przykładów będzie zaniżony.

Trzy mechanizmy, które realnie obniżają rachunek:

  • Przetwarzanie wsadowe (batch). Jeśli odpowiedź nie jest potrzebna od razu (raporty nocne, klasyfikacja archiwum), OpenAI, Anthropic i Google liczą za takie zapytania 50% standardowej ceny (OpenAI, Anthropic, Google).
  • Cache promptów. Gdy wiele zapytań zaczyna się od tych samych instrukcji lub dokumentów, ta część może być liczona taniej. U Anthropic odczyt z cache kosztuje co najwyżej 10% ceny zwykłych tokenów wejściowych (Anthropic, cennik).
  • Dobór modelu do zadania. Klasyfikację zgłoszeń czy wyciąganie pól z formularza zwykle obsłuży mały model. Flagowy zostaw do zadań, w których naprawdę widać różnicę.

Uwzględnij też dopłaty: OpenAI dolicza 10% za przetwarzanie w wybranym regionie (data residency) dla modeli wydanych od 5 marca 2026 r. (OpenAI).

Co dzieje się z danymi Twojej firmy?

W planach API dostawcy domyślnie nie trenują modeli na danych klientów, ale to dopiero początek analizy, a nie jej koniec. Tak wyglądają zasady trzech głównych dostawców:

  • OpenAI: dane wysłane przez API nie są używane do trenowania ani ulepszania modeli, chyba że klient wyrazi na to zgodę. Logi do wykrywania nadużyć są przechowywane do 30 dni, a dla uprawnionych klientów dostępna jest opcja zerowej retencji (Zero Data Retention). Można też wybrać region przetwarzania, w tym Europę (EOG i Szwajcaria) (OpenAI).
  • Anthropic: domyślnie nie używa danych wejściowych ani wyjściowych z produktów komercyjnych (API, Claude for Work) do trenowania modeli (Anthropic). W bezpośrednim API można wymusić inferencję wyłącznie w USA albo zostawić ustawienie globalne; w Amazon Bedrock i Google Cloud region wynika z wybranego endpointu (Anthropic).
  • Google: w płatnym Gemini API prompty i odpowiedzi nie są używane do ulepszania produktów. W bezpłatnym mogą być, ale użytkowników z EOG, Szwajcarii i Wielkiej Brytanii warunki płatne obejmują również przy darmowym limicie (Google).

Z perspektywy RODO dostawca jest zwykle podmiotem przetwarzającym, więc potrzebujesz umowy powierzenia (DPA), wiedzy, gdzie dane są przetwarzane, i podstawy do ewentualnego transferu poza EOG. Ustal też zasady, czego nie wysyłać wcale: dane medyczne, numery PESEL, tajemnice przedsiębiorstwa. Darmowe aplikacje konsumenckie mają inne zasady niż API, dlatego pracownicy powinni korzystać z kont firmowych.

Jeśli udostępniasz klientom czat oparty na takim modelu, pamiętaj o AI Act: od 2 sierpnia 2026 r. osoba rozmawiająca z systemem AI musi wiedzieć, że nie rozmawia z człowiekiem, chyba że wynika to jasno z kontekstu (Komisja Europejska).

Jakie szybkie wygrane da się wdrożyć od razu?

Takie, w których model działa na tekście, który i tak ktoś czyta lub pisze, a człowiek zatwierdza wynik. Najczęstsze:

  • Szkice treści: opisy produktów, odpowiedzi na typowe maile, pierwsze wersje ofert.
  • Streszczenia: notatki ze spotkań, raporty, długie wątki korespondencji.
  • Klasyfikacja i routing: nadawanie kategorii i priorytetu zgłoszeniom, zanim trafią do człowieka.
  • Wyciąganie danych: pola z faktur, umów i formularzy do arkusza lub systemu.
  • Analiza: wstępne wnioski z arkuszy, porównanie dokumentów, burza mózgów.

Sami pracujemy w ten sposób: w pimento zarządzamy firmą przez repozytorium, w którym agent AI w roli asystenta COO spisuje notatki ze spotkań, zamienia ustalenia w zadania i co tydzień przygotowuje podsumowanie.

Najważniejsza lekcja z takich wdrożeń: jakość promptu często znaczy więcej niż wybór modelu. Kontekst, przykład dobrej odpowiedzi i oczekiwany format dają więcej niż przejście na droższy model.

Kiedy podstawowe użycie przestaje wystarczać?

Wtedy, gdy model zaczyna mylić się w sprawach Twojej firmy: procedurach, produktach, umowach. Model zna internet, ale nie zna Twoich dokumentów. Rozwiązaniem jest RAG (Retrieval-Augmented Generation): system najpierw wyszukuje właściwe fragmenty w dokumentach firmy, a potem przekazuje je modelowi razem z pytaniem. Model odpowiada na ich podstawie i może wskazać źródło. Szczegóły opisujemy w artykule o tym, jak RAG sprawia, że AI wie, a nie zgaduje.

Typowa architektura hybrydowa wygląda tak:

  1. Aplikacja (czat, helpdesk, narzędzie wewnętrzne) przyjmuje pytanie.
  2. System wyszukiwania znajduje pasujące fragmenty w dokumentach firmy.
  3. Pytanie i fragmenty trafiają do modelu przez API.
  4. Model generuje odpowiedź z odwołaniami do źródeł.
  5. Aplikacja pokazuje odpowiedź, a w sprawach wrażliwych czeka na akceptację człowieka.

Model wymienisz tu bez przebudowy całości, bo wiedza firmy jest w wyszukiwarce, nie w modelu. Ten sam schemat da się uruchomić w całości lokalnie: nasza agentowa baza wiedzy działa na własnych GPU, z modelami lokalnymi, a każde twierdzenie w odpowiedzi ma przypis do fragmentu dokumentu.

Kiedy wybrać model otwarty albo własną infrastrukturę?

Gdy co najmniej jedno z poniższych jest prawdą:

  • Dane nie mogą opuścić firmy z powodów prawnych lub umownych: dokumentacja medyczna, dane finansowe klientów, tajemnica przedsiębiorstwa.
  • Wolumen jest duży i przewidywalny, więc stały koszt sprzętu jest niższy niż rosnący rachunek za tokeny.
  • Potrzebujesz kontroli nad wersją modelu, żeby wynik był powtarzalny przez lata, niezależnie od harmonogramu wycofywania modeli przez dostawcę.
  • Zadanie jest wąskie i specjalistyczne, a mniejszy, dostrojony model robi je równie dobrze i taniej.

To nie jest teoria. Uruchamiamy modele językowe, embeddingi, reranker oraz rozpoznawanie i syntezę mowy na własnej infrastrukturze GPU, dzięki czemu dokumenty, pytania i nagrania klientów przetwarzamy bez wysyłania ich do zewnętrznych API. Dla Fundacji MT5 dostarczyliśmy klaster GPU, który stoi u klienta, i trenujemy na nim modele na danych z badań snu. Jak wygląda AI na własnej infrastrukturze, pokazujemy na stronie Infrastruktura AI.

Jak podjąć decyzję: kupić dostęp czy budować?

Zacznij od modelu zamkniętego, jeśli potrzebujesz szybkiego efektu, pracujesz na typowych danych biznesowych, nie masz zespołu ML i chcesz najpierw sprawdzić, czy AI w ogóle rozwiązuje Twój problem. Rozważ własne rozwiązanie, gdy dane są wrażliwe, skala jest duża albo potrzebujesz pełnej kontroli. Szerszy schemat tej decyzji opisujemy w przewodniku budować czy kupić AI.

Twoja sytuacjaRekomendowany start
Pierwszy projekt AI, typowe dane, mały zespół ITModel zamknięty przez API, konta firmowe, proste prompty
Model myli się w sprawach firmyAPI + RAG na dokumentach firmy
Dane osobowe w dużej skali, wymagany region UEAPI z przetwarzaniem w UE i umową powierzenia albo model lokalny
Dane, które nie mogą opuścić firmyModel otwarty na własnej infrastrukturze
Duży, stabilny wolumen prostych zadańPolicz model otwarty lub mały model zamknięty w trybie wsadowym
Wąskie zadanie specjalistyczneDostrojony model otwarty

Jak zacząć w praktyce?

  1. Wybierz jedno zastosowanie z wyraźnym kosztem obecnego procesu.
  2. Przygotuj zestaw testowy: kilkadziesiąt prawdziwych pytań lub dokumentów z oczekiwanymi odpowiedziami. Na nim porównasz modele i prompty.
  3. Sprawdź zasady danych: plan biznesowy lub API, umowa powierzenia, region, lista danych, których nie wysyłasz.
  4. Uruchom pilotaż z udziałem ludzi, którzy wykonują to zadanie, i zmierz czas oraz jakość przed i po.
  5. Zaplanuj wymienność modelu od pierwszego dnia: warstwa pośrednia, zestaw testowy, monitoring kosztów.

Modele zamknięte to nie kompromis, tylko rozsądny pierwszy krok. Najpierw zdobądź wartość i wiedzę o tym, co działa, a dopiero potem inwestuj w rozwiązania budowane na miarę.

Źródła