Grafická karta NVIDIA RTX PRO 6000 Blackwell Max-Q 96GB GDDR7 ECC
Kentino · AI server na míru

NVIDIA RTX PRO 6000 Blackwell Max-Q 96 GB GDDR7 ECC

Platforma podnikové třídy, sestavená a otestovaná v EU.

€22.000,00 bez DPH · dopravu spočítáme v košíku
Skladem — expedice ze skladu v EU
ISO 9001 · ověřený hardwareSklad a záruka v EU7+ let ve firemní AIPřed expedicí otestováno zátěží
Přehled
Časté dotazy
Doprava a záruka
Blackwell · 96 GB ECC · 300 W

NVIDIA RTX PRO 6000 Blackwell Max-Q — 96 GB pro on-premise AI

Plnohodnotné 96GB GPU Blackwell v příkonovém rámci 300 W. Stejná jednotná ECC VRAM a stejný výpočetní čip jako u 600W karty, ale s polovičním příkonem — volba pro případy, kdy limit určuje teplota, hluk nebo sdílená skříň workstationu.

96 GB
GDDR7 ECC VRAM
24,064
CUDA jádra
~1.8 TB/s
Propustnost paměti
300 W
Příkon karty
Přehled

96 GB jednotné VRAM při 300 W

Varianta Max-Q nese stejný čip Blackwell a stejných 96 GB ECC GDDR7 jako plnovýkonná RTX PRO 6000, má ale příkon omezený na 300 W. To znamená víc, než se na první pohled zdá: jediná karta udrží model třídy 70B ve 4bitové kvantizaci celý v jednom jednotném paměťovém prostoru, takže odpadá dělení tensor-parallel, přenosy mezi GPU po PCIe i práce s rozdělením modelu. Oproti skládání herních karet na stejnou kapacitu VRAM získáte ECC paměť, zlomek příkonu a jediný slot místo několika.

Specifikace

Technické údaje

GPU NVIDIA GB202 — Blackwell
Katalogové číslo 900-5G153
Paměť 96 GB GDDR7 ECC, 512bit
Propustnost paměti ~1.8 TB/s
CUDA jádra 24,064
Tensor jádra 752 (5. generace) · ~2,000 TOPS INT8
RT jádra 188 (4. generace)
Rozhraní PCIe 5.0 ×16
Příkon karty 300 W (16pinový 12V-2×6)
Chlazení Aktivní radiální ventilátor, dvouslotová
Obrazové výstupy 4× DisplayPort 2.1b
Záruka 36 měsíců
Nejvhodnější pro

Kam se hodí

  • Inference modelu 70B na jediné kartě — 96 GB udrží 70B model ve 4 bitech v jednom paměťovém prostoru, bez dělení modelu.
  • Tiché workstationy a kanceláře, kde je 600W karta příliš horká a hlučná.
  • Multi-GPU sestavy s omezeným příkonovým rozpočtem — čtyři Max-Q mají zhruba stejnou spotřebu jako dvě plnovýkonné karty.
  • Fine-tuning středně velkých modelů, kde záleží na ECC paměti a stabilitě při dlouhém běhu.
  • Generování obrazu a videa s velkými modely trvale uloženými ve VRAM.
Orientační propustnost jednoho streamu: zhruba 25–35 tok/s u modelu 70B ve 4 bitech a výrazně přes 100 tok/s u modelu 8B. Jde o orientační odhady z publikovaných externích zdrojů, nikoli o měření na hardwaru Kentino — napište nám svůj model a délku kontextu a nadimenzujeme to přesně.
Dotazy

FAQ

Čím se Max-Q liší od 600W karty?

Stejné GPU, stejných 96 GB ECC GDDR7, stejná propustnost paměti. Max-Q má strop 300 W místo 600 W, takže u výpočetně náročných úloh je trvalá propustnost nižší — každý model, který se vejde do 96 GB, se ale vejde dál a právě kapacita VRAM obvykle rozhoduje o tom, zda model vůbec poběží.

Zvládne jedna karta opravdu model 70B?

Ano. Model 70B ve 4bitové kvantizaci potřebuje zhruba 40 GB, takže se do 96 GB vejde s velkou rezervou pro KV cache a dlouhý kontext. To je hlavní důvod volit tuto kartu místo několika menších.

Potřebuji ECC paměť?

Pro interaktivní práci ne. U bezobslužných tréninků, dlouhých dávkových úloh nebo všude, kde by tichý překlopený bit znehodnotil výsledek, je ECC rozdíl mezi spolehlivým strojem a nevysvětlitelnou chybou.

Vejde se do mé skříně?

Jde o dvouslotovou aktivně chlazenou kartu, takže se vejde do běžných tower i 4U sestav. Ověřte si, že máte volný slot PCIe 5.0 ×16 a k dispozici 16pinový napájecí konektor 12V-2×6.

Jaká je dodací lhůta?

Tyto karty objednáváme na zakázku — obvykle 10–21 dní. Dostupnost tohoto dílu se rychle mění, proto si ji u nás před plánováním termínu nechte potvrdit.

Chcete tuto kartu v hotovém stroji? Kentino staví, benchmarkuje a uvádí do provozu kompletní AI servery a workstationy s RTX PRO 6000 — řekněte si o nakonfigurovanou sestavu.

Otázky, které nám kupující kladou před objednávkou serveru nejčastěji.

Jak dlouho to trvá?

Stroje sestavené z komponent, které máme skladem, expedujeme rychle; cokoli, co vyžaduje konkrétní generaci GPU, závisí na dostupnosti. Termín Vám sdělíme ještě před platbou, a pokud se posune, dáme Vám vědět sami, místo abyste na to museli přijít.

Lze konfiguraci změnit ještě před sestavením?

Téměř vždy. GPU, paměť, úložiště i chlazení volíme podle konkrétní objednávky a uvedená konfigurace je spíš výchozím bodem než pevně daným balíkem. Pokud potřebujete více VRAM, rychlejší úložiště nebo jiné řešení chlazení, dejte nám vědět ještě před objednávkou a změnu Vám naceníme.

Mohu si server vyzvednout osobně?

Ano, můžete. Náš sklad je v Praze a osobní odběr vítáme — většina těch, kdo přijedou, využije návštěvu k tomu, aby si stroj prošla s naším technikem a zeptala se na věci, které se e-mailem řeší těžko. U objednávek v rámci České republiky se také snažíme doručovat osobně a provést Vás nastavením přímo na místě.

Mohu mluvit s někým, kdo opravdu rozumí workloadu?

Ano. Máme inženýra, který se věnuje přímo AI systémům, nikoli obecné obchodní oddělení. Pokud se ptáte na velikosti batchů, kvantizaci, propojení nebo na to, kde bude Vaše úzké hrdlo, zeptejte se — takový rozhovor obvykle posune konfiguraci k lepšímu.

Jaký model na této konfiguraci spustím?

Ano. Každý stroj je sestaven, podroben burn-in testu a změřen na reálných AI workloadech ještě před expedicí a odchází od nás s již nainstalovaným a běžícím LLM. Zapojíte jej, připojíte do své sítě a začnete pracovat — zbývá jediné rozhodnutí: na jakém projektu poběží jako prvním.

Jak testujete server před expedicí?

Testujeme ji na skutečných AI workloadech, ne na syntetických skóre: propustnost inference, chování při dlouhodobé zátěži a teploty v nepřetržitém provozu. Výsledky benchmarků dostanete spolu se strojem, takže si slíbený výkon můžete ověřit hned první den.

Je server po dodání připravený k provozu?

Ano. Každý stroj je sestaven, podroben burn-in testu a změřen na reálných AI workloadech ještě před expedicí a odchází od nás s již nainstalovaným a běžícím LLM. Zapojíte jej, připojíte do své sítě a začnete pracovat — zbývá jediné rozhodnutí: na jakém projektu poběží jako prvním.

Expedujeme z našeho skladu v EU. U těžkých položek může být nutná přeprava nákladní dopravou — napište si o cenovou nabídku dopravy a dodací lhůtu. Dvouletá omezená záruka s přednostním RMA servisem, prodloužená záruka na vyžádání.

Není to přesně to, co potřebujete?

Řekněte nám, jaký workload provozujete, a my Vám tuto platformu navrhneme na míru — GPU, paměť, úložiště i chlazení podle toho, co u Vás skutečně běží.