Szybka odpowiedź
Próg opłacalności własnego serwera to miesięczny koszt serwera podzielony przez uśrednioną cenę 1 mln tokenów w API, policzoną dla Twojego ruchu. Decydują dwie rzeczy: jak mocno wykorzystasz GPU i z jakim API się porównujesz. Wobec drogich modeli zamkniętych serwer z jedną kartą zwraca się już przy kilkuset milionach tokenów miesięcznie. Wobec tanich API, w tym tego samego otwartego modelu kupowanego u dostawcy, próg bywa wyższy niż to, co jedna karta w ogóle przerobi. Jeśli dane nie mogą wychodzić z firmy, koszt przestaje być jedynym kryterium.
Wszystkie ceny w tym tekście to publiczne cenniki z 8 października 2026 r., w USD, bez VAT. Nie podajemy naszych kosztów: przykład opiera się wyłącznie na jawnych założeniach, które możesz podmienić na własne.
Z czego składa się koszt własnego serwera GPU?
Cena karty to tylko część rachunku. Miesięczny koszt całkowity (TCO) liczymy tak:
koszt miesięczny = (sprzęt ÷ liczba miesięcy używania) + prąd + miejsce w serwerowni + czas ludzi
| Składnik | Jak liczyć | Na co uważać |
|---|---|---|
| Sprzęt | cena GPU i reszty serwera ÷ okres używania w miesiącach | Ceny kart w 2026 r. mocno rosną. Na NVIDIA Marketplace RTX PRO 6000 Blackwell Workstation Edition kosztował w sierpniu 16 000 USD, wobec 8565 USD na starcie w 2025 r. (Let's Data Science) |
| Prąd | średni pobór w kW × 730 godzin × cena za kWh | Liczy się pobór całego serwera, nie tylko karty, plus chłodzenie |
| Serwerownia | kolokacja albo udział w kosztach własnej serwerowni | Zasilanie awaryjne, łącze, dostęp fizyczny |
| Ludzie | godziny admina miesięcznie × stawka | Aktualizacje sterowników i silnika, monitoring, reakcja na awarie sprzętu |
| Zapas | druga karta albo awaryjne API | Bez zapasu awaria karty zatrzymuje usługę |
Czas ludzi jest najczęściej pomijany. Silniki do serwowania modeli wychodzą w nowych wersjach co kilka tygodni, nowe modele wymagają aktualizacji, a karty GPU pod stałym obciążeniem też się psują. Ktoś musi to obsłużyć.
Jak policzyć, ile naprawdę płacisz za 1 mln tokenów w API?
Cennik API podaje osobne ceny za tokeny wejściowe (prompt), wyjściowe (odpowiedź) i za wejście odczytane z cache. Żeby porównać API z serwerem, trzeba je uśrednić według Twojego ruchu:
cena uśredniona = udział wejścia × (część bez cache × cena wejścia + część z cache × cena cache) + udział wyjścia × cena wyjścia
Proporcje zależą od zastosowania:
- RAG i bazy wiedzy: prompt zawiera fragmenty dokumentów, więc wejście jest wielokrotnie dłuższe niż odpowiedź.
- Agenci: każdy krok agenta wysyła całą dotychczasową historię i wyniki narzędzi, więc wejście rośnie z każdym krokiem. Duża część tego wejścia to powtórzony prefiks, który trafia w cache.
- Generowanie treści: krótkie polecenie, długa odpowiedź. Tu proporcje są odwrotne i API jest relatywnie drogie.
U nas w ruchu agentów i baz wiedzy tokeny wejściowe stanowią zdecydowaną większość. Dlatego w przykładzie niżej przyjmujemy 20 tokenów wejścia na 1 token wyjścia i połowę wejścia z cache. To założenie, nie pomiar Twojego systemu: najlepiej zmierz własny ruch na kilku dniach pilotażu.
Dwie pułapki:
- Tokeny różnych dostawców to nie ta sama jednostka. Anthropic podaje, że tokenizer modeli od Claude 4.7 daje dla tego samego tekstu ok. 30% więcej tokenów niż poprzedni (Anthropic, cennik). Przy porównaniu z modelem lokalnym liczy się koszt obsłużenia tego samego zapytania, nie cena tokena.
- Zapis do cache też kosztuje. U Anthropic zapis do 5-minutowego cache to 1,25 ceny wejścia. W przykładzie to pomijamy, co lekko zaniża koszt API.
Ile kosztuje 1 mln tokenów w API w październiku 2026?
Ceny standardowe za 1 mln tokenów i cena uśredniona przy naszych założeniach (20:1, połowa wejścia z cache):
| Model | Wejście | Wejście z cache | Wyjście | Cena uśredniona |
|---|---|---|---|---|
| GPT-5.5 (OpenAI) | 5,00 USD | 0,50 USD | 30,00 USD | 4,05 USD |
| Claude Opus 5.5 (Anthropic) | 4,00 USD | 0,20 USD | 20,00 USD | 2,95 USD |
| Claude Sonnet 5.5 (Anthropic) | 2,00 USD | 0,10 USD | 10,00 USD | 1,48 USD |
| GPT-5.4-mini (OpenAI) | 0,75 USD | 0,075 USD | 4,50 USD | 0,61 USD |
| Gemini 3.8 Flash (Google, do 31.12.2026) | 0,75 USD | 0,075 USD | 3,75 USD | 0,57 USD |
| Qwen3.6-27B (DeepInfra, otwarty model) | 0,32 USD | brak w cenniku | 3,20 USD | 0,46 USD |
| Claude Haiku 5.5 (Anthropic, prompt do 100 tys.) | 0,10 USD | 0,01 USD | 0,50 USD | 0,08 USD |
Źródła: OpenAI, Anthropic, Google, DeepInfra. Google zapowiada, że od 1 stycznia 2027 r. ceny Gemini 3.8 Flash wzrosną dwukrotnie, a uśredniona stawka do ok. 1,14 USD. Interfejsy wsadowe (Batch) u OpenAI i Anthropic kosztują połowę ceny, jeśli możesz czekać na wynik.
Najważniejszy wiersz to Qwen3.6-27B. To otwarty model, który możesz uruchomić u siebie, a ten sam model kupiony przez API kosztuje kilkadziesiąt centów za milion tokenów. Uczciwe porównanie kosztów to właśnie: ten sam model u siebie albo u dostawcy. Porównanie z modelami zamkniętymi mówi więcej o różnicy w jakości niż o kosztach serwera.
Próg opłacalności: wzór i przykład z jawnymi założeniami
próg (tokeny miesięcznie) = koszt miesięczny serwera ÷ cena uśredniona za 1 mln tokenów
Założenia przykładu. Każde z nich podmień na własne:
| Założenie | Wartość w przykładzie | Skąd |
|---|---|---|
| Karta GPU klasy 96 GB | 16 000 USD | cena RTX PRO 6000 Blackwell Workstation Edition na NVIDIA Marketplace, sierpień 2026 (źródło) |
| Reszta serwera (CPU, RAM, dyski, obudowa, zasilacze) | 10 000 USD | założenie |
| Okres używania | 36 miesięcy | założenie |
| Średni pobór serwera | 1 kW | założenie |
| Cena prądu | 0,25 USD za kWh | założenie, wstaw stawkę z faktury |
| Kolokacja | 300 USD miesięcznie | założenie |
| Praca admina | 8 h × 75 USD miesięcznie | założenie |
Wynik: sprzęt 722 USD + prąd 183 USD + kolokacja 300 USD + ludzie 600 USD = ok. 1805 USD miesięcznie.
Próg opłacalności przy tym koszcie:
| Porównanie z | Cena uśredniona | Próg miesięcznie | Próg dziennie |
|---|---|---|---|
| GPT-5.5 | 4,05 USD | ok. 0,45 mld tokenów | ok. 15 mln |
| Claude Opus 5.5 | 2,95 USD | ok. 0,61 mld | ok. 20 mln |
| Claude Sonnet 5.5 | 1,48 USD | ok. 1,22 mld | ok. 41 mln |
| GPT-5.4-mini | 0,61 USD | ok. 2,97 mld | ok. 99 mln |
| Gemini 3.8 Flash (ceny 2026) | 0,57 USD | ok. 3,16 mld | ok. 105 mln |
| Qwen3.6-27B przez API | 0,46 USD | ok. 3,95 mld | ok. 132 mln |
| Claude Haiku 5.5 | 0,08 USD | ok. 23,7 mld | ok. 790 mln |
Rozrzut jest ogromny: od kilkunastu milionów do kilkuset milionów tokenów dziennie. Dlatego analizy w internecie podają progi, które różnią się o rzędy wielkości. Każda porównuje się z innym API i przyjmuje inny ruch.
Czy jedna karta w ogóle przerobi tyle tokenów?
Próg ma sens tylko wtedy, gdy serwer jest w stanie go osiągnąć. Przepustowość zależy od modelu, precyzji wag, długości promptów i liczby równoległych zapytań, więc najlepiej zmierzyć ją na własnym ruchu.
Publiczny punkt odniesienia: w teście vLLM na jednej karcie RTX PRO 6000 Blackwell Server Edition (50 równoległych zapytań, 100 tokenów wejścia i 600 wyjścia) model 32B w BF16 osiągnął ok. 970 tokenów na sekundę łącznie, a Qwen3-14B ok. 2030 (Database Mart). To test z krótkimi promptami i długimi odpowiedziami. W RAG, gdzie dominują długie prompty, a część z nich trafia w cache prefiksów, łączna liczba przetworzonych tokenów na sekundę jest zwykle wyższa, bo prompt przetwarza się równolegle, a nie token po tokenie.
Przeliczenie: 1000 tokenów na sekundę przez cały miesiąc to ok. 2,5 mld tokenów. Ale firmowy ruch nie jest równy przez całą dobę: w nocy i w weekendy karta stoi. Przy średnim wykorzystaniu 40% zostaje ok. 1 mld tokenów miesięcznie.
Wniosek z przykładu:
- Wobec drogich modeli zamkniętych (GPT-5.5, Opus 5.5) próg leży w zasięgu jednej karty przy przyzwoitym wykorzystaniu.
- Wobec modeli średnich (Sonnet 5.5) jesteś blisko granicy i decyduje to, czy model lokalny daje Ci wystarczającą jakość.
- Wobec tanich API i tego samego otwartego modelu u dostawcy jedna karta nie osiągnie progu. Sam koszt nie uzasadni wtedy własnego serwera.
To samo pokazuje literatura: analiza kosztów z 2025 r. dochodzi do wniosku, że próg zależy od poziomu użycia i wymagań wydajnościowych, a nie od jednej magicznej liczby (Pan i in., arXiv 2509.18101).
Kupić serwer, wynająć GPU czy płacić za tokeny?
Jest też trzecia droga: wynajem GPU w chmurze na godziny. Na RunPod karta RTX PRO 6000 kosztuje w październiku 2026 r. 2,09 USD za godzinę w Secure Cloud, H100 SXM 3,49 USD, a B200 6,79 USD (RunPod).
| Wariant | Koszt miesięczny w przykładzie | Kiedy ma sens |
|---|---|---|
| Płacenie za tokeny | zależny od ruchu | mały lub nieprzewidywalny ruch, start projektu, dane mogą wyjść z firmy |
| Wynajem GPU 24/7 | ok. 1526 USD + czas ludzi | testy, pilotaż, ruch sezonowy, brak serwerowni |
| Własny serwer | ok. 1805 USD (z czasem ludzi) | stały ruch na lata, dane nie mogą wyjść, własne modele |
Zakup za 26 000 USD zwraca się wobec wynajmu 24/7 po ok. 25 miesiącach (26 000 ÷ (1526 − 483), gdzie 483 USD to prąd i kolokacja). Przy krótszym horyzoncie albo przy pracy tylko w godzinach biurowych wynajem wychodzi taniej. Pamiętaj, że wynajęty GPU to nadal cudza infrastruktura: sprawdź, gdzie fizycznie stoi i kto ma do niej dostęp.
Kiedy koszt nie jest głównym argumentem?
Większość firm, z którymi rozmawiamy o własnym serwerze, nie zaczyna od kosztu. Zaczyna od pytania, czy dane mogą wyjść z firmy. Argumenty za własnym serwerem poza ceną:
- Dane nie opuszczają sieci. Dokumentacja medyczna, akta, dane klientów i tajemnica przedsiębiorstwa zostają u Ciebie. Szerzej piszemy o tym w artykule o modelach zamkniętych.
- Przewidywalny koszt. Rachunek za serwer jest stały, niezależnie od tego, ile razy agent odpyta model.
- Brak limitów zapytań. Własny serwer nie zwróci błędu 429 w środku przetwarzania wsadowego.
- Własny model. Dostrojony klasyfikator albo adapter LoRA serwujesz obok modelu bazowego, bez opłat za hosting modeli dostrojonych. Przykład opisujemy w artykule mały model z LoRA czy duży model z promptem.
- Stabilna wersja modelu. Model u Ciebie nie zmieni się bez Twojej decyzji.
Argumenty przeciw, które też trzeba uczciwie postawić:
- Jakość. Najlepsze modele zamknięte nadal bywają lepsze od otwartych w trudnych zadaniach. Jak wybrać otwarty model, piszemy w artykule Qwen, Gemma, GLM, Mistral czy Bielik.
- Utrzymanie. Serwer GPU to kolejny system produkcyjny z dyżurami, aktualizacjami i awariami.
- Elastyczność. W API zmiana modelu to jedna linijka. Na serwerze to pobranie wag, test i wdrożenie.
Lista kontrolna przed decyzją
- Zmierz ruch. Ile tokenów wejścia i wyjścia dziennie, jaka część promptów się powtarza, w jakich godzinach jest ruch.
- Policz cenę uśrednioną dla 2-3 API, w tym dla tego samego otwartego modelu u dostawcy.
- Policz koszt miesięczny serwera z wszystkimi składnikami, także czasem ludzi i zapasem na awarię.
- Zmierz przepustowość wybranego modelu na swoim ruchu, a nie na benchmarku z krótkimi promptami.
- Przyjmij realne wykorzystanie, czyli godziny pracy firmy, a nie 24/7.
- Sprawdź wymogi dotyczące danych: umowy z klientami, tajemnicę zawodową, politykę bezpieczeństwa. Jeśli dane nie mogą wyjść, porównanie z publicznym API odpada.
- Zacznij od pilotażu na wynajętym GPU albo na demo, zanim kupisz sprzęt.
Jak to liczymy u siebie
Utrzymujemy własne serwery z GPU NVIDIA Blackwell i serwujemy na nich modele z rodzin Qwen, Gemma, GLM i Mistral. Przed każdym wyłączeniem kontenera z modelem zapisujemy liczniki tokenów wejściowych i wyjściowych, trafień w cache prefiksów i wywłaszczeń. Dzięki temu wiemy, jak wygląda prawdziwy ruch, a nie tylko szacunek z arkusza. To ta sama metoda, którą proponujemy klientom: najpierw pomiar na przykładowych zapytaniach, potem decyzja o sprzęcie.
Jeśli chcesz sprawdzić, ile tokenów generuje Twój przypadek i jak szybko odpowiada model na GPU, możesz zamówić demo. Jak projektujemy serwery i serwowanie modeli, opisujemy na stronie Infrastruktura AI. Ile pamięci potrzebuje model, liczymy w przewodniku ile VRAM do lokalnego LLM, a szersze porównanie ścieżek wdrożenia znajdziesz w artykule budować czy kupić AI.
Źródła
Cenniki API (stan na 8 października 2026):
Sprzęt i wynajem GPU:
- Let's Data Science: Nvidia Lists RTX PRO 6000 Blackwell at $16,000 (12.08.2026)
- RunPod: Pricing
- Database Mart: vLLM GPU benchmark na RTX PRO 6000
Metoda:
