Szybka odpowiedź

Próg opłacalności własnego serwera to miesięczny koszt serwera podzielony przez uśrednioną cenę 1 mln tokenów w API, policzoną dla Twojego ruchu. Decydują dwie rzeczy: jak mocno wykorzystasz GPU i z jakim API się porównujesz. Wobec drogich modeli zamkniętych serwer z jedną kartą zwraca się już przy kilkuset milionach tokenów miesięcznie. Wobec tanich API, w tym tego samego otwartego modelu kupowanego u dostawcy, próg bywa wyższy niż to, co jedna karta w ogóle przerobi. Jeśli dane nie mogą wychodzić z firmy, koszt przestaje być jedynym kryterium.

Wszystkie ceny w tym tekście to publiczne cenniki z 8 października 2026 r., w USD, bez VAT. Nie podajemy naszych kosztów: przykład opiera się wyłącznie na jawnych założeniach, które możesz podmienić na własne.

Z czego składa się koszt własnego serwera GPU?

Cena karty to tylko część rachunku. Miesięczny koszt całkowity (TCO) liczymy tak:

koszt miesięczny = (sprzęt ÷ liczba miesięcy używania) + prąd + miejsce w serwerowni + czas ludzi

SkładnikJak liczyćNa co uważać
Sprzętcena GPU i reszty serwera ÷ okres używania w miesiącachCeny kart w 2026 r. mocno rosną. Na NVIDIA Marketplace RTX PRO 6000 Blackwell Workstation Edition kosztował w sierpniu 16 000 USD, wobec 8565 USD na starcie w 2025 r. (Let's Data Science)
Prądśredni pobór w kW × 730 godzin × cena za kWhLiczy się pobór całego serwera, nie tylko karty, plus chłodzenie
Serwerowniakolokacja albo udział w kosztach własnej serwerowniZasilanie awaryjne, łącze, dostęp fizyczny
Ludziegodziny admina miesięcznie × stawkaAktualizacje sterowników i silnika, monitoring, reakcja na awarie sprzętu
Zapasdruga karta albo awaryjne APIBez zapasu awaria karty zatrzymuje usługę

Czas ludzi jest najczęściej pomijany. Silniki do serwowania modeli wychodzą w nowych wersjach co kilka tygodni, nowe modele wymagają aktualizacji, a karty GPU pod stałym obciążeniem też się psują. Ktoś musi to obsłużyć.

Jak policzyć, ile naprawdę płacisz za 1 mln tokenów w API?

Cennik API podaje osobne ceny za tokeny wejściowe (prompt), wyjściowe (odpowiedź) i za wejście odczytane z cache. Żeby porównać API z serwerem, trzeba je uśrednić według Twojego ruchu:

cena uśredniona = udział wejścia × (część bez cache × cena wejścia + część z cache × cena cache) + udział wyjścia × cena wyjścia

Proporcje zależą od zastosowania:

  • RAG i bazy wiedzy: prompt zawiera fragmenty dokumentów, więc wejście jest wielokrotnie dłuższe niż odpowiedź.
  • Agenci: każdy krok agenta wysyła całą dotychczasową historię i wyniki narzędzi, więc wejście rośnie z każdym krokiem. Duża część tego wejścia to powtórzony prefiks, który trafia w cache.
  • Generowanie treści: krótkie polecenie, długa odpowiedź. Tu proporcje są odwrotne i API jest relatywnie drogie.

U nas w ruchu agentów i baz wiedzy tokeny wejściowe stanowią zdecydowaną większość. Dlatego w przykładzie niżej przyjmujemy 20 tokenów wejścia na 1 token wyjścia i połowę wejścia z cache. To założenie, nie pomiar Twojego systemu: najlepiej zmierz własny ruch na kilku dniach pilotażu.

Dwie pułapki:

  1. Tokeny różnych dostawców to nie ta sama jednostka. Anthropic podaje, że tokenizer modeli od Claude 4.7 daje dla tego samego tekstu ok. 30% więcej tokenów niż poprzedni (Anthropic, cennik). Przy porównaniu z modelem lokalnym liczy się koszt obsłużenia tego samego zapytania, nie cena tokena.
  2. Zapis do cache też kosztuje. U Anthropic zapis do 5-minutowego cache to 1,25 ceny wejścia. W przykładzie to pomijamy, co lekko zaniża koszt API.

Ile kosztuje 1 mln tokenów w API w październiku 2026?

Ceny standardowe za 1 mln tokenów i cena uśredniona przy naszych założeniach (20:1, połowa wejścia z cache):

ModelWejścieWejście z cacheWyjścieCena uśredniona
GPT-5.5 (OpenAI)5,00 USD0,50 USD30,00 USD4,05 USD
Claude Opus 5.5 (Anthropic)4,00 USD0,20 USD20,00 USD2,95 USD
Claude Sonnet 5.5 (Anthropic)2,00 USD0,10 USD10,00 USD1,48 USD
GPT-5.4-mini (OpenAI)0,75 USD0,075 USD4,50 USD0,61 USD
Gemini 3.8 Flash (Google, do 31.12.2026)0,75 USD0,075 USD3,75 USD0,57 USD
Qwen3.6-27B (DeepInfra, otwarty model)0,32 USDbrak w cenniku3,20 USD0,46 USD
Claude Haiku 5.5 (Anthropic, prompt do 100 tys.)0,10 USD0,01 USD0,50 USD0,08 USD

Źródła: OpenAI, Anthropic, Google, DeepInfra. Google zapowiada, że od 1 stycznia 2027 r. ceny Gemini 3.8 Flash wzrosną dwukrotnie, a uśredniona stawka do ok. 1,14 USD. Interfejsy wsadowe (Batch) u OpenAI i Anthropic kosztują połowę ceny, jeśli możesz czekać na wynik.

Najważniejszy wiersz to Qwen3.6-27B. To otwarty model, który możesz uruchomić u siebie, a ten sam model kupiony przez API kosztuje kilkadziesiąt centów za milion tokenów. Uczciwe porównanie kosztów to właśnie: ten sam model u siebie albo u dostawcy. Porównanie z modelami zamkniętymi mówi więcej o różnicy w jakości niż o kosztach serwera.

Próg opłacalności: wzór i przykład z jawnymi założeniami

próg (tokeny miesięcznie) = koszt miesięczny serwera ÷ cena uśredniona za 1 mln tokenów

Założenia przykładu. Każde z nich podmień na własne:

ZałożenieWartość w przykładzieSkąd
Karta GPU klasy 96 GB16 000 USDcena RTX PRO 6000 Blackwell Workstation Edition na NVIDIA Marketplace, sierpień 2026 (źródło)
Reszta serwera (CPU, RAM, dyski, obudowa, zasilacze)10 000 USDzałożenie
Okres używania36 miesięcyzałożenie
Średni pobór serwera1 kWzałożenie
Cena prądu0,25 USD za kWhzałożenie, wstaw stawkę z faktury
Kolokacja300 USD miesięczniezałożenie
Praca admina8 h × 75 USD miesięczniezałożenie

Wynik: sprzęt 722 USD + prąd 183 USD + kolokacja 300 USD + ludzie 600 USD = ok. 1805 USD miesięcznie.

Próg opłacalności przy tym koszcie:

Porównanie zCena uśrednionaPróg miesięczniePróg dziennie
GPT-5.54,05 USDok. 0,45 mld tokenówok. 15 mln
Claude Opus 5.52,95 USDok. 0,61 mldok. 20 mln
Claude Sonnet 5.51,48 USDok. 1,22 mldok. 41 mln
GPT-5.4-mini0,61 USDok. 2,97 mldok. 99 mln
Gemini 3.8 Flash (ceny 2026)0,57 USDok. 3,16 mldok. 105 mln
Qwen3.6-27B przez API0,46 USDok. 3,95 mldok. 132 mln
Claude Haiku 5.50,08 USDok. 23,7 mldok. 790 mln

Rozrzut jest ogromny: od kilkunastu milionów do kilkuset milionów tokenów dziennie. Dlatego analizy w internecie podają progi, które różnią się o rzędy wielkości. Każda porównuje się z innym API i przyjmuje inny ruch.

Czy jedna karta w ogóle przerobi tyle tokenów?

Próg ma sens tylko wtedy, gdy serwer jest w stanie go osiągnąć. Przepustowość zależy od modelu, precyzji wag, długości promptów i liczby równoległych zapytań, więc najlepiej zmierzyć ją na własnym ruchu.

Publiczny punkt odniesienia: w teście vLLM na jednej karcie RTX PRO 6000 Blackwell Server Edition (50 równoległych zapytań, 100 tokenów wejścia i 600 wyjścia) model 32B w BF16 osiągnął ok. 970 tokenów na sekundę łącznie, a Qwen3-14B ok. 2030 (Database Mart). To test z krótkimi promptami i długimi odpowiedziami. W RAG, gdzie dominują długie prompty, a część z nich trafia w cache prefiksów, łączna liczba przetworzonych tokenów na sekundę jest zwykle wyższa, bo prompt przetwarza się równolegle, a nie token po tokenie.

Przeliczenie: 1000 tokenów na sekundę przez cały miesiąc to ok. 2,5 mld tokenów. Ale firmowy ruch nie jest równy przez całą dobę: w nocy i w weekendy karta stoi. Przy średnim wykorzystaniu 40% zostaje ok. 1 mld tokenów miesięcznie.

Wniosek z przykładu:

  • Wobec drogich modeli zamkniętych (GPT-5.5, Opus 5.5) próg leży w zasięgu jednej karty przy przyzwoitym wykorzystaniu.
  • Wobec modeli średnich (Sonnet 5.5) jesteś blisko granicy i decyduje to, czy model lokalny daje Ci wystarczającą jakość.
  • Wobec tanich API i tego samego otwartego modelu u dostawcy jedna karta nie osiągnie progu. Sam koszt nie uzasadni wtedy własnego serwera.

To samo pokazuje literatura: analiza kosztów z 2025 r. dochodzi do wniosku, że próg zależy od poziomu użycia i wymagań wydajnościowych, a nie od jednej magicznej liczby (Pan i in., arXiv 2509.18101).

Kupić serwer, wynająć GPU czy płacić za tokeny?

Jest też trzecia droga: wynajem GPU w chmurze na godziny. Na RunPod karta RTX PRO 6000 kosztuje w październiku 2026 r. 2,09 USD za godzinę w Secure Cloud, H100 SXM 3,49 USD, a B200 6,79 USD (RunPod).

WariantKoszt miesięczny w przykładzieKiedy ma sens
Płacenie za tokenyzależny od ruchumały lub nieprzewidywalny ruch, start projektu, dane mogą wyjść z firmy
Wynajem GPU 24/7ok. 1526 USD + czas ludzitesty, pilotaż, ruch sezonowy, brak serwerowni
Własny serwerok. 1805 USD (z czasem ludzi)stały ruch na lata, dane nie mogą wyjść, własne modele

Zakup za 26 000 USD zwraca się wobec wynajmu 24/7 po ok. 25 miesiącach (26 000 ÷ (1526 − 483), gdzie 483 USD to prąd i kolokacja). Przy krótszym horyzoncie albo przy pracy tylko w godzinach biurowych wynajem wychodzi taniej. Pamiętaj, że wynajęty GPU to nadal cudza infrastruktura: sprawdź, gdzie fizycznie stoi i kto ma do niej dostęp.

Kiedy koszt nie jest głównym argumentem?

Większość firm, z którymi rozmawiamy o własnym serwerze, nie zaczyna od kosztu. Zaczyna od pytania, czy dane mogą wyjść z firmy. Argumenty za własnym serwerem poza ceną:

  • Dane nie opuszczają sieci. Dokumentacja medyczna, akta, dane klientów i tajemnica przedsiębiorstwa zostają u Ciebie. Szerzej piszemy o tym w artykule o modelach zamkniętych.
  • Przewidywalny koszt. Rachunek za serwer jest stały, niezależnie od tego, ile razy agent odpyta model.
  • Brak limitów zapytań. Własny serwer nie zwróci błędu 429 w środku przetwarzania wsadowego.
  • Własny model. Dostrojony klasyfikator albo adapter LoRA serwujesz obok modelu bazowego, bez opłat za hosting modeli dostrojonych. Przykład opisujemy w artykule mały model z LoRA czy duży model z promptem.
  • Stabilna wersja modelu. Model u Ciebie nie zmieni się bez Twojej decyzji.

Argumenty przeciw, które też trzeba uczciwie postawić:

  • Jakość. Najlepsze modele zamknięte nadal bywają lepsze od otwartych w trudnych zadaniach. Jak wybrać otwarty model, piszemy w artykule Qwen, Gemma, GLM, Mistral czy Bielik.
  • Utrzymanie. Serwer GPU to kolejny system produkcyjny z dyżurami, aktualizacjami i awariami.
  • Elastyczność. W API zmiana modelu to jedna linijka. Na serwerze to pobranie wag, test i wdrożenie.

Lista kontrolna przed decyzją

  1. Zmierz ruch. Ile tokenów wejścia i wyjścia dziennie, jaka część promptów się powtarza, w jakich godzinach jest ruch.
  2. Policz cenę uśrednioną dla 2-3 API, w tym dla tego samego otwartego modelu u dostawcy.
  3. Policz koszt miesięczny serwera z wszystkimi składnikami, także czasem ludzi i zapasem na awarię.
  4. Zmierz przepustowość wybranego modelu na swoim ruchu, a nie na benchmarku z krótkimi promptami.
  5. Przyjmij realne wykorzystanie, czyli godziny pracy firmy, a nie 24/7.
  6. Sprawdź wymogi dotyczące danych: umowy z klientami, tajemnicę zawodową, politykę bezpieczeństwa. Jeśli dane nie mogą wyjść, porównanie z publicznym API odpada.
  7. Zacznij od pilotażu na wynajętym GPU albo na demo, zanim kupisz sprzęt.

Jak to liczymy u siebie

Utrzymujemy własne serwery z GPU NVIDIA Blackwell i serwujemy na nich modele z rodzin Qwen, Gemma, GLM i Mistral. Przed każdym wyłączeniem kontenera z modelem zapisujemy liczniki tokenów wejściowych i wyjściowych, trafień w cache prefiksów i wywłaszczeń. Dzięki temu wiemy, jak wygląda prawdziwy ruch, a nie tylko szacunek z arkusza. To ta sama metoda, którą proponujemy klientom: najpierw pomiar na przykładowych zapytaniach, potem decyzja o sprzęcie.

Jeśli chcesz sprawdzić, ile tokenów generuje Twój przypadek i jak szybko odpowiada model na GPU, możesz zamówić demo. Jak projektujemy serwery i serwowanie modeli, opisujemy na stronie Infrastruktura AI. Ile pamięci potrzebuje model, liczymy w przewodniku ile VRAM do lokalnego LLM, a szersze porównanie ścieżek wdrożenia znajdziesz w artykule budować czy kupić AI.

Źródła

Cenniki API (stan na 8 października 2026):

Sprzęt i wynajem GPU:

Metoda: