To druga część serii. W Części 1 liczymy pamięć wag i cache KV krok po kroku i opisujemy karty od RTX 5060 Ti do RTX PRO 4000.

Szybka odpowiedź

96 GB (RTX PRO 6000 Blackwell) to próg firmowego RAG i backendu agentów: modele 30B dla dziesiątek użytkowników, ~70B dla kilku, MoE 100-120B. Jeden B300 (288 GB HBM3E, 8 TB/s) obsłuży ~70B dla wielu użytkowników albo MoE klasy 235B w FP4. Otwarte modele klasy frontier, od 0,7 do 2,8 biliona parametrów, wymagają węzła 8×B300 (2,1 TB) albo kilku węzłów. Taki węzeł wytrenuje od zera mały model i dotrenuje duży, ale trening od zera modelu na poziomie czołówki to zadanie dla klastrów z tysiącami GPU.

Co zmieści się na którym GPU?

Tabela pokazuje stan na 14 września 2026 r. „Realnie” oznacza: wagi plus cache KV na sensowny kontekst, z ok. 10% zapasu.

PoziomVRAMPrzepustowość pamięciCo realnie się mieściTypowe zastosowanie
RTX PRO 6000 Blackwell96 GB GDDR7 z ECC1792 GB/s (Server Edition: 1597 GB/s)24-32B w FP8 z dużym zapasem, ~70B w FP8 lub FP4, MoE 100-120B (gpt-oss-120b, Mistral Small 4 w NVFP4)RAG i agenci dla firmy, dziesiątki użytkowników na modelu 30B, QLoRA modeli 70B
B300 (jeden GPU)288 GB HBM3E8 TB/s~70B w BF16 lub FP8, MoE ~235B w FP4, DeepSeek-V4-Flashserwowanie modeli wielu użytkownikom, pełny fine-tuning modeli ~8B
8×B300 (HGX/DGX B300)2,1 TB HBM3E łącznie8 × 8 TB/s, NVLink 1,8 TB/s na GPUotwarte MoE 0,7-1,6 bln parametrów w FP8 lub FP4, 2,4-2,8 bln tylko w FP4modele klasy frontier w produkcji, pełny fine-tuning do ~70B, trening od zera małych modeli

W pimento uruchamiamy modele na NVIDIA Blackwell, ale ten tekst nie opisuje naszej konfiguracji. To ogólny przewodnik po rynku, oparty na specyfikacjach NVIDIA i kartach modeli na Hugging Face.

Metoda w skrócie

Pełne obliczenia z przykładem z config.json są w Części 1, w sekcji o liczeniu pamięci. Tutaj tylko reguły, których używamy niżej:

  • Wagi ≈ parametry × bajty na parametr: BF16 2 bajty, FP8 1 bajt, FP4 ok. 0,6 bajta (z rzeczywistych rozmiarów plików NVFP4 i MXFP4).
  • Cache KV na token = 2 × warstwy × głowy KV × wymiar głowy × bajty. Dla Llama 3.3 70B to ok. 0,33 MB na token w BF16, czyli ok. 10,7 GB na 32 tys. tokenów. Cache w FP8 zajmuje połowę.
  • Pamięć użyteczna ≈ 90% VRAM, a pamięć na cache to pamięć użyteczna minus wagi.
  • MoE: pamięć liczysz od wszystkich parametrów, szybkość od aktywnych.
  • Szybkość: sufit tokenów na sekundę dla jednej rozmowy ≈ przepustowość pamięci ÷ bajty aktywnych wag. Llama 3.3 70B w FP8 (~71 GB) ma sufit ~25 tokenów/s na RTX PRO 6000 i ~113 tokenów/s na B300.

Jakie parametry mają te GPU?

Wszystkie dane pochodzą ze stron produktowych, kart katalogowych i whitepaperów NVIDIA. Nie podajemy cen: strony NVIDIA ich nie podają, a ceny zmieniają się co tydzień.

GPUVRAMPrzepustowośćFP4 / FP8Połączenie między GPUForma i moc
RTX PRO 6000 Blackwell Workstation Edition96 GB GDDR7 z ECC, 512 bit1792 GB/stak / tak, 4000 AI TOPSPCIe 5.0, NVIDIA nie wymienia NVLinkdwa gniazda, 600 W
RTX PRO 6000 Blackwell Max-Q96 GB GDDR7 z ECC, 512 bit1792 GB/stak / tak, 3511 AI TOPSPCIe 5.0 x16, do 4 kart w stacji roboczejdwa gniazda, 300 W
RTX PRO 6000 Blackwell Server Edition96 GB GDDR7 z ECC, 512 bit1597 GB/s4 PFLOPS FP4, 2 PFLOPS FP8PCIe 5.0, NVIDIA nie wymienia NVLinkserwer, chłodzenie pasywne lub cieczą, do 600 W (konfigurowalne)
B300 (Blackwell Ultra)288 GB HBM3E8 TB/s15 PFLOPS FP4 (NVFP4, gęste), 5 PFLOPS FP8 (gęste)NVLink 5: 1,8 TB/s na GPU; host: PCIe 6.0 x16moduł SXM w płycie HGX, do 1400 W
HGX/DGX B300 (8 GPU)2,1 TB HBM3E łącznie8 × 8 TB/s (nasze wyliczenie, NVIDIA nie podaje sumy)108 PFLOPS FP4 gęste, 72 PFLOPS FP8 z rzadkościąNVLink 5 przez przełączniki, 14,4 TB/s łącznieDGX B300: 10U, ok. 14 kW

Kilka uwag do tabeli:

  • „AI TOPS” kart RTX PRO to FP4 z rzadkością (sparsity), czyli wartość teoretyczna. Whitepaper RTX Blackwell potwierdza obsługę FP8 i FP4 w rdzeniach Tensor kart konsumenckich i profesjonalnych.
  • Pamięć B300. Blog techniczny NVIDIA podaje 288 GB HBM3E na GPU, a strony HGX i DGX B300 podają 2,1 TB na 8 GPU, czyli ok. 262 GB na GPU. NVIDIA nie wyjaśnia tej różnicy. W obliczeniach dla jednego B300 używamy 288 GB, a dla węzła 2,1 TB.
  • Moc obliczeniowa B300. Blog podaje 15 PFLOPS FP4 (gęste) na GPU, a strona HGX 108 PFLOPS FP4 (gęste) na 8 GPU, czyli 13,5 na GPU. Tej różnicy NVIDIA też nie wyjaśnia.
  • B300 nie jest kartą do włożenia w PC. To moduł SXM sprzedawany w systemach HGX/DGX (8 GPU) albo w szafach GB300 NVL72. Poziom „jeden B300” w tym tekście oznacza jeden GPU z takiego systemu, np. wynajęty w chmurze.

RTX PRO 6000 Blackwell 96 GB: dlaczego to próg dla firmy?

96 GB z ECC i 1792 GB/s (Server Edition 1597 GB/s). Trzy wersje: Workstation Edition (600 W), Max-Q (300 W, do 4 kart w stacji) i Server Edition (pasywna, do serwerów, do 8 kart w RTX PRO Server). Karta dzieli się też na izolowane instancje MIG: do 4 × 24 GB, 2 × 48 GB lub 1 × 96 GB, co pozwala uruchomić np. cztery niezależne modele 8B. Pamięć użyteczna to ok. 86 GB.

Klasa modeluCzy się mieściPrecyzjaRealny kontekst i współbieżność
gęsty 7-14Btak, swobodnieBF16 lub FP87-9B w BF16: ~475 tys. tokenów w cache BF16, dziesiątki rozmów albo 4 instancje MIG. 14B w FP8: ~440 tys.
gęsty 24-32BtakFP8 (32,8 GB) albo BF16 (65,6 GB)FP8: ~200 tys. tokenów w BF16, ~400 tys. w FP8. Np. 25 rozmów po 16 tys.
gęsty ~70B (Llama 3.3 70B)takFP8 (~71 GB) albo FP4 (~42 GB)FP8: ~48 tys. tokenów w BF16, ~96 tys. w FP8, kilka osób. FP4: ~134 tys. w BF16
MoE ~30B-A3Btak, swobodnieBF16 lub FP8FP8: ~570 tys. tokenów w BF16. Dziesiątki użytkowników
MoE ~100-120B (gpt-oss-120b, Mistral Small 4, GLM-4.5-Air)takgpt-oss-120b w MXFP4 (65,2 GB), Mistral Small 4 w NVFP4 (70,8 GB), GLM-4.5-Air w FP4 (~64 GB)gpt-oss-120b: ~21 GB na cache przy ~0,04 MB na token. GLM-4.5-Air: ~120 tys. tokenów. Kilka-kilkanaście osób
MoE ~235Bnie na jednej karcieFP4 to ~141 GB2 karty w FP4, 4 karty w FP8
frontier 0,7-1T+nie na jednej karcieNVFP4 to ~400-415 GB8 kart (768 GB) w RTX PRO Server, przez PCIe

Co realnie zrobisz:

  • RAG dla zespołu i firmy: tak. Model 30B w FP8 albo MoE 30B-A3B obsłuży dziesiątki osób z kontekstem 16 tys. tokenów.
  • Backend agentów dla firmy: tak, na modelach 30B-120B. gpt-oss-120b mieści się w całości na jednej karcie z dużym budżetem kontekstu.
  • LoRA: na bazie BF16 do ~32B. QLoRA modelu 70B: autorzy QLoRA dostrajali model 65B na jednym GPU 48 GB.
  • Pełny fine-tuning: modele rzędu 3-4B (96 GB ÷ 16 bajtów na parametr to 6B, zanim policzysz aktywacje).
  • Wielu użytkowników: dziesiątki na modelach do 30B.
  • Kilka kart: 2 × 96 GB mieści Qwen3-235B-A22B w FP4, 4 × Max-Q (384 GB) w FP8 z ~110 GB na cache, a 8 kart w RTX PRO Server (8 × 96 = 768 GB) mieści modele ~700B w NVFP4, np. DeepSeek-V3.1 (413 GB) albo Mistral Large 3 (403 GB), z ~280 GB na cache. Wszystko to jednak przez PCIe, bez NVLink.

B300: co zmienia jeden GPU klasy centrum danych?

288 GB HBM3E i 8 TB/s, czyli 3 razy więcej pamięci i 4,5 raza większa przepustowość niż RTX PRO 6000. Do tego NVLink 5 (1,8 TB/s na GPU) do pozostałych GPU w węźle. Pamięć użyteczna to ok. 259 GB.

Klasa modeluCzy się mieściPrecyzjaRealny kontekst i współbieżność
gęsty 7-14BtakBF16ponad 1,4 mln tokenów cache. Setki rozmów
gęsty 24-32BtakBF16 lub FP8FP8: ~860 tys. tokenów w BF16
gęsty ~70BtakBF16 (~141 GB) albo FP8 (~71 GB)FP8: ~575 tys. tokenów w BF16, ~1,15 mln w FP8. Np. 70 rozmów po 16 tys. Sufit generowania ~113 tokenów/s na rozmowę
MoE ~30B-A3BtakBF16ponad 2 mln tokenów
MoE ~100-120BtakFP8 lub FP4GLM-4.5-Air w FP8 (~113 GB): ~810 tys. tokenów
MoE ~235B (Qwen3-235B-A22B, DeepSeek-V4-Flash)takFP4 (~141 GB) dla Qwen3-235B. FP8 (236 GB) zostawia ~24 GB, czyli za mało dla wielu osób. DeepSeek-V4-Flash: oficjalne pliki 167 GBQwen3-235B w FP4: ~610 tys. tokenów w BF16
frontier 0,7-1T+nieNVFP4 to ~400 GB i więcejwymaga co najmniej 2 GPU, w praktyce węzła

Co realnie zrobisz:

  • Serwowanie wielu użytkownikom: do tego jest ten poziom. Wysoka przepustowość daje szybkie odpowiedzi, a duża pamięć pozwala trzymać cache setek rozmów.
  • Backend agentów dla firmy: modele do 235B MoE na jednym GPU.
  • LoRA: na bazie BF16 do ~70B (141 GB wag plus aktywacje).
  • Pełny fine-tuning: modele ~8B (16 bajtów × 8,2B to ok. 131 GB plus aktywacje), ~14B na granicy.
  • Trening od zera: małe modele eksperymentalne, nie modele produkcyjnej klasy (szczegóły przy klastrze).

Klaster 8×B300: co mieści węzeł HGX lub DGX B300?

Węzeł HGX B300 lub DGX B300 to 8 GPU Blackwell Ultra, 2,1 TB HBM3E, NVLink 5 z przełącznikami (1,8 TB/s na GPU, 14,4 TB/s łącznie), 108 PFLOPS FP4 (gęste) i ok. 14 kW w obudowie 10U (DGX). Pamięć użyteczna to ok. 1,9 TB. To pierwszy poziom, na którym mieszczą się w całości otwarte modele klasy frontier:

ModelParametry (łącznie, aktywne)Oficjalne plikiNa 8×B300
DeepSeek-V3.1671B, 37B689 GB (FP8)tak, ~1,2 TB na cache
Mistral Large 3675B, 41B682 GB (FP8), 403 GB (NVFP4)tak. Mistral podaje FP8 na jednym węźle B200 lub H200
GLM-5744B, 40B756 GB (wersja FP8)tak, ~1,1 TB na cache
Kimi K2.61T, 32B595 GB (natywny INT4)tak, ~1,3 TB na cache
DeepSeek-V4-Pro-08131,6T, 49B893 GBtak. DeepSeek pokazuje uruchomienie na jednym węźle 4×GB300
Kimi K32,8T, 104B1,56 TB (MXFP4)tak, ~330 GB na cache
Qwen3.8-2.4T-A95B2,4T, 95B2,5 TB (wersja FP8)nie w FP8. Wymaga kwantyzacji do FP4 (wg naszego wyliczenia ~1,4-1,5 TB) albo dwóch węzłów

Liczby parametrów DeepSeek-V4-Pro pochodzą z tabeli w karcie DeepSeek-V4.1-Flash (1,6T parametrów „backbone”, 49B aktywnych), bo karta V4-Pro-0813 ich nie podaje. Rozmiary plików to suma plików safetensors w repozytoriach na Hugging Face.

Cache w tych modelach jest mały dzięki MLA: dla Kimi K2 i DeepSeek-V3 to ok. 0,07 MB na token (z config.json: 61 warstw × (512 + 64) × 2 bajty). Przy ~1,2 TB wolnej pamięci daje to miliony tokenów cache, czyli setki równoległych rozmów agentowych z długim kontekstem.

Co realnie zrobisz na 8×B300:

  • Serwowanie modeli frontier wielu użytkownikom: tak, to główne zastosowanie.
  • LoRA i QLoRA dużych MoE: tak. OpenAI pisze, że gpt-oss-120b da się dostroić na jednym węźle H100 (8 × 80 GB), a węzeł B300 ma ponad trzy razy więcej pamięci.
  • Pełny fine-tuning: gęste modele do ok. 70B (16 bajtów × 70B to ~1,1 TB stanu modelu, rozłożone na 8 GPU przez FSDP lub ZeRO-3, plus aktywacje).
  • Trening od zera: małe modele tak, modele na poziomie czołówki nie. Liczby poniżej.

Ile trwałby trening od zera na jednym węźle?

Koszt treningu szacuje się wzorem C ≈ 6 × N × D operacji (N to parametry, D to tokeny treningowe) (Kaplan i in., 2020). HGX B300 podaje 36 PFLOPS w BF16 z rzadkością, czyli 18 PFLOPS gęstych. Zakładamy, że trening wykorzystuje 40% tej mocy (to nasze założenie, typowe dla dobrze zoptymalizowanego treningu, nie pomiar), czyli ~7,2 PFLOPS.

Model i daneObliczeniaCzas na jednym 8×B300 (BF16, 40%)
1B na 20 mld tokenów (~20 tokenów na parametr, jak w Chinchilli)1,2 × 10²⁰~4,6 godziny
7B na 140 mld tokenów5,9 × 10²¹~9,5 dnia
8B na 15 bln tokenów (dzisiejsza praktyka)7,2 × 10²³~3,2 roku
70B na 15 bln tokenów6,3 × 10²⁴~28 lat

Trening w FP8 mniej więcej podwaja tempo, ale rząd wielkości zostaje. Dla porównania z kartami modeli: Llama 3.3 70B (trenowana na ponad 15 bln tokenów) zużyła 7,0 mln godzin GPU H100, DeepSeek-V3 2,788 mln godzin GPU H800, a Mistral Large 3 był trenowany na 3000 GPU H200. Wniosek: jeden węzeł wytrenuje od zera mały model do badań albo wąskiego zadania, ale model, który konkuruje z czołówką, to praca dla klastrów z tysiącami GPU połączonych szybką siecią.

Jak działa podział modelu na kilka GPU (tensor parallelism i pipeline parallelism), opisujemy w Części 1. W skrócie: PCIe 5.0 x16 daje 128 GB/s (NVIDIA, H100), a NVLink 5 w B300 1,8 TB/s na GPU, czyli ok. 14 razy więcej. Dokumentacja vLLM zaleca tensor parallelism, gdy model mieści się w jednym węźle, a dla GPU bez NVLink pipeline parallelism (vLLM).

  • RTX PRO 6000: NVIDIA nie wymienia NVLink w specyfikacji. Skalowanie idzie przez PCIe. RTX PRO Server z 8 kartami używa kart ConnectX-8 z wbudowanym przełącznikiem PCIe 6.0, który według NVIDIA podwaja przepustowość między GPU w porównaniu z osobnymi przełącznikami PCIe, ale to wciąż nie NVLink.
  • B300 w HGX/DGX: wszystkie 8 GPU łączą przełączniki NVLink, więc tensor parallelism na 8 GPU jest standardem, a węzły łączy się siecią 800 Gb/s (ConnectX-8).

Ile pamięci potrzebuje fine-tuning na tych poziomach?

Rachunek jest ten sam co w Części 1: QLoRA trzyma zamrożoną bazę w 4 bitach (Dettmers i in., 2023), LoRA w BF16 (Hu i in., 2021), a pełny fine-tuning z Adamem w mieszanej precyzji potrzebuje 16 bajtów na parametr, bez aktywacji (Rajbhandari i in., ZeRO).

PoziomQLoRALoRA (baza BF16)Pełny fine-tuning
RTX PRO 6000 96 GB~70Bdo ~32B~3-4B
B300 288 GBduże MoE do ~235Bdo ~70B~8B, 14B na granicy
8×B300 2,1 TBmodele klasy frontierMoE ~235B w BF16gęste do ~70B

To szacunki z wzorów, zaokrąglone w dół, bo aktywacje rosną z długością sekwencji i rozmiarem batcha. Gradient checkpointing, optymalizatory 8-bitowe i przenoszenie stanu optymalizatora do RAM przesuwają te granice w górę kosztem czasu.

Jak wybrać między RTX PRO 6000, B300 a klastrem?

Zacznij od zadania, nie od karty: jakiej jakości modelu potrzebujesz, ile osób będzie z niego korzystać naraz i jak długi kontekst przetwarzasz.

Twoja sytuacjaRozsądny poziom
RAG i agenci dla firmy, dziesiątki użytkowników, dane nie opuszczają firmyRTX PRO 6000 Blackwell (1-4 karty)
MoE 235B lub ~700B na własnym sprzęcie bez NVLink2-8 × RTX PRO 6000 z pipeline parallelism, z niższą przepustowością niż na B300
Produkcyjny serwis dla setek użytkowników, modele 70-235BGPU B300 (własne lub wynajęte)
Otwarte modele klasy frontier, pełny fine-tuning do 70Bwęzeł 8×B300
Własny model konkurujący z czołówką, trenowany od zeraklaster wielu węzłów, w praktyce tysiące GPU

Jeśli wystarczy Ci asystent osobisty albo RAG dla kilku osób, karty od 16 do 32 GB opisujemy w Części 1.

Jak projektujemy AI na własnej infrastrukturze, od doboru GPU po serwowanie modeli, pokazujemy na stronie Infrastruktura AI. Kiedy w ogóle warto przejść z API na własny model, opisujemy w artykule budować czy kupić AI.

Źródła

Specyfikacje GPU:

Karty modeli i konfiguracje:

Metoda, serwowanie i trening: