Kentino KI 192 Rome RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — EPYC Milan
Plattform in Enterprise-Qualität, in der EU montiert und getestet.
Kentino AI 192 Rome RTXPro6000 4000TOPS
192 GB ECC Blackwell Flaggschiff-Duo
2x RTX Pro 6000 Server Edition | EPYC Milan | 4 000 TOPS INT8
Zwei passive Karten vom Typ RTX Pro 6000 Blackwell Server Edition — je 96 GB ECC. Weniger Tensor-Parallel-Overhead als bei Systemen mit 4 oder 8 Karten. Das Flaggschiff-Duo fürs Rechenzentrum.
Ein 4U-Inferenz-Server für den Rack-Einbau mit zwei passiven Karten vom Typ RTX Pro 6000 Blackwell Server Edition (96 GB ECC GDDR7 pro Karte), einer AMD EPYC 7643 Milan CPU (48C/96T), 256 GB DDR4 ECC, 2 TB NVMe als Bootlaufwerk und einem einzelnen 2-kW-ATX-Netzteil. Für dichte 70B-Modelle in bf16 und mittelgroße MoE-Modelle schlagen wenige große Karten viele kleine — Tensor-Parallelismus über zwei Karten verursacht nur minimalen Kommunikations-Overhead, und jede 96-GB-Karte trägt eine vollständige Kopie der meisten Modelle.
Hardware
| Komponente | Detail |
|---|---|
| GPUs | 2x NVIDIA RTX Pro 6000 Blackwell Server Edition 96 GB ECC GDDR7 (passiv, 600 W, PCIe 5.0 x16, Dual-Slot) |
| VRAM-Pool | 192 GB ECC (96 GB x 2) — jede Karte fasst ein 70B-Modell in bf16 eigenständig |
| CPU | AMD EPYC 7643 Milan (48C/96T, 225 W, 128x PCIe 4.0 Lanes) |
| Mainboard | ASRock Rack ROMED8-2T (SP3, 7x PCIe 4.0 x16, 8x DDR4 ECC, 2x 10 GbE, IPMI) |
| Arbeitsspeicher | 256 GB DDR4-2666 ECC RDIMM (4x 64 GB) |
| Boot / Speicher | 2 TB NVMe M.2 (PCIe 4.0 x4) |
| Netzteil | 1x 2-kW-ATX-Netzteil |
| Gehäuse | 4U für den Rack-Einbau mit gerichtetem Luftstrom von vorne nach hinten |
| Kühlung | Arctic Freezer 4U-M SP3 Tower + 3x 120 mm Zuluft vorne + 1x 120 mm Abluft hinten |
| Netzwerk | Onboard zwei 10 GbE (Intel X550) |
Leistungsbudget
- GPU-Aufnahme: 2 x 600 W = 1 200 W
- Systemgesamtaufnahme unter Volllast: ~1 525 W
- Netzteil gesamt: 2 000 W (einzelnes 2 kW) — 23.7 % Reserve
- Ein Netzteil genügt; optionales Upgrade auf zwei Netzteile für N+1-Redundanz
Lane-Topologie
PCIe Gen4 x16 pro GPU (die Karte ist nativ Gen5; das Rome-Board begrenzt auf Gen4). Direkte Anbindung an den Root-Complex — kein PCIe-Switch. Kein NVLink — Peer-to-Peer zwischen den GPUs. Fünf x16-Steckplätze bleiben für Erweiterungen frei. Gen4 statt Gen5 ist bei dieser VRAM-Dichte für die Inferenz vernachlässigbar.
Was Sie betreiben können
Mit 192 GB ECC-VRAM auf nur zwei Blackwell-Karten mit nativem fp8/fp4 ist dies der sauberste Weg zu dichten 70B-Modellen in bf16 und mittelgroßen MoE-Modellen. Zwei unabhängige 70B-Streams — einer pro Karte — oder ein 200B-MoE-Modell über beide Karten mit minimalem Overhead bei 2-Wege-TP.
LLMs — Text / Reasoning / Coding
Chinesische Spitzenmodelle
- Qwen3 / Qwen3.5 (Alibaba): Qwen3-235B-A22B Q4 (~132 GB) komfortabel mit langem ctx (~15-25 Tok/s im Einzelstream über 2 Karten); Qwen3-Coder-480B-A35B Q2 (~160 GB); Qwen3.5-122B-A10B fp8 (~75 GB); Qwen3-32B dicht in bf16 mit riesigem KV; QwQ-32B bf16
- DeepSeek: DeepSeek-V3/R1 Q2 (~215 GB mit geringer Auslagerung in den Arbeitsspeicher) — Blackwell führt fp8 nativ aus; DeepSeek-R2 32B bf16 in zwei parallelen Streams (einer pro Karte)
- GLM / Z.ai: GLM-4.5 / 4.6 / 4.7 Q4 (~177 GB) — die Paradekonfiguration dieser Klasse; GLM-4.5-Air fp8 oder bf16 mit riesigem KV
- Tencent Hunyuan: Hunyuan-Large Q3 (~160 GB) — 389B MoE mit 256k ctx; Hunyuan-A13B fp8 nativ (~80 GB) mit riesigem KV
- Weitere: Baidu ERNIE-4.5-424B Q3 (~180 GB); InternVL3.5-241B-A28B Q4 (~135 GB); MiniMax-M1 Q3 (~180 GB)
Westliche Spitzenmodelle
- Meta Llama: Llama 3.3 70B bf16 auf einer Karte — zwei unabhängige parallele 70B-Streams (~20-30 Tok/s pro Stream); Llama 4 Scout bf16 (~218 GB, knapp); Llama 4 Maverick Q3 (~188 GB)
- Mistral: Mistral Large 2 / Pixtral Large / Devstral 2 123B Q6 (~88 GB) auf einer Karte oder bf16 über beide; Mistral Small 3 im Multi-Stream-Betrieb
- OpenAI (offene Gewichte): gpt-oss-120b MXFP4 nativ (80 GB) — passt auf EINE Karte, zwei unabhängige parallele Streams
- NVIDIA Nemotron: Llama-3.1-Nemotron Ultra 253B Q4 (~147 GB); Super 49B bf16 auf einer einzelnen Karte
- Weitere: Cohere Command R+ 104B Q6 (~85 GB) auf einer Karte; Google Gemma 3 27B bf16 in mehreren parallelen Streams
Vision-Language-Modelle
InternVL3.5-241B-A28B Q4 (~135 GB); Qwen3-VL-235B-A22B Q4; Qwen3-VL-32B bf16 auf einer Karte; Pixtral Large 124B bf16 oder Q6; Llama 3.2 90B Vision bf16 (~180 GB); Molmo 72B bf16 (~144 GB); GLM-4.6V 106B fp8; Gemma 3 27B multimodal x 2-3 parallele Streams.
Bildgenerierung
FLUX.1 [dev] bf16 in mehreren parallelen Streams; FLUX.1 Kontext [dev]; FLUX Tools; SD 3.5 Large bf16 parallel; HunyuanImage-2.1 bf16 (~34 GB) x 2-4 parallel; HunyuanImage-3.0 base (80B MoE, 13B aktiv) bf16 — passt auf eine Karte; HunyuanDiT; Kolors / Kolors 2.0; AuraFlow; OmniGen v1; PixArt-Sigma.
Videogenerierung
Wan 2.2 MoE mit zwei Experten in bf16 und vollem Kontext — passt auf eine Karte, zwei parallele Generierungs-Streams; Wan 2.2 TI2V-5B; HunyuanVideo 13B bf16 mit beiden Experten; HunyuanVideo 1.5; CogVideoX-5B bf16; Open-Sora 2.0 11B bf16; Mochi-1 bf16 (~42 GB); LTX-Video; Pyramid Flow; SVD / SV3D / SV4D; NVIDIA Cosmos Predict 2.
Audio / Sprache / TTS
- ASR: Whisper v3 large / turbo (~50-fache Echtzeit); Parakeet-TDT; Canary 1B; Qwen3-ASR; SenseVoice
- TTS: CosyVoice 2/3; Kokoro 82M; XTTS v2; Stable Audio Open; Step-Audio-EditX
- Echtzeit / S2S: Kyutai Moshi 7B; Step-Audio 2 mini/R1; Qwen2.5-Omni-7B
- Musik / SFX: MusicGen / AudioGen / Bark; SeamlessM4T v2
Multi-Modell- / Multi-Tenant-Serving
- Zwei unabhängige 70B-Streams — einer pro Karte, die einfachste Form der Mandantentrennung
- Dichtes 70B-Modell in bf16 + unterstützender Stack — LLM auf Karte 1, Bild/Video/Audio auf Karte 2
- 200B-MoE-Modell über beide Karten — minimaler Tensor-Parallel-Overhead (2-Wege-Aufteilung)
- Spitzenmodelle mit nativem fp8 — DeepSeek-V3-Familie, Hunyuan-Large fp8 über die nativen Blackwell-Pfade
Ziel-Workloads
- Inferenz dichter 70B-Modelle in bf16 — zwei Karten tensor-parallel mit minimalem Overhead oder ein Modell pro Karte für das Streaming
- 100-150B MoE in Q4-Q6 (GLM-4.5-Air, Qwen3.5-122B-A10B, Hunyuan-A13B, Llama 4 Scout)
- Inferenz von Spitzenmodellen mit nativem FP8 (DeepSeek-V3-Familie, Hunyuan, Llama 4) — Blackwell führt fp8 nativ aus
- Studio für Bild- und Videogenerierung in bf16 (Wan 2.2 T2V-A14B, HunyuanVideo 13B, FLUX.1 [dev])
- Dokumentenanalyse mit langem Kontext (MiniMax-M1, Kimi-K2 1.58-Bit UD mit Auslagerung)
Gemessene Leistung
Veröffentlichte Referenzen | Datenblatt der NVIDIA RTX Pro 6000 Blackwell Server Edition + Community-Benchmarks
| Benchmark | Ergebnis |
|---|---|
| INT8-TOPS pro Karte (NVIDIA-Datenblatt) | 2 000 TOPS |
| INT8-TOPS gesamt (2 Karten) | 4 000 TOPS |
| Speicherbandbreite pro Karte | ~1 800 GB/s, 96 GB ECC GDDR7 |
| Llama 3.3 70B bf16 pro Karte (Community) | 15-25 Tok/s im Einzelstream, 60-90 Tok/s im Batch |
| 70B tensor-parallel über zwei Karten (Community) | ~30-45 Tok/s im Einzelstream zu erwarten |
| Blackwell fp8 nativ | DeepSeek-V3 fp8, Hunyuan-A13B fp8 laufen ohne Upcast auf bf16 |
Veröffentlichte externe Referenzen, nicht auf Kentino-Hardware gemessen. Kentino wird nach dem ersten Kundenaufbau eigene Messwerte veröffentlichen.
Weniger geeignet für
- Multi-Tenant-Serving mit sehr hoher Parallelität — 4x L40 oder 6x L4 verteilen die Last besser auf mehr Karten
- Umfangreichen KV-Cache bei sehr langem Kontext — steigen Sie auf Kentino AI 384 RTXPro6000 8000TOPS um
- Training — Kentino vertreibt keine NVLink-Fabrics der H-Klasse
- Günstige Inferenz mit 192-GB-Pool — 8x RTX 4090 sind preiswerter (dafür entfallen ECC und passive Kühlung)
Garantie und Lieferzeit
NVIDIA-OEM-Garantie von 3 Jahren auf die RTX Pro 6000 Server Edition + Kentino-Integrationsgarantie. Der Aufbau umfasst Montage, BIOS-Konfiguration, Treiberinstallation, Burn-in-Tests und Funktionsprüfung. Die Lieferzeit hängt von der Verfügbarkeit der Komponenten ab und wird bei Bestellung bestätigt.
Empfohlenes Zubehör
- Upgrade auf zwei synchronisierte 2-kW-Netzteile für N+1-Redundanz
- Upgrade des Arbeitsspeichers auf 512 GB (4 DIMM-Steckplätze frei)
- 4 TB NVMe für große Gewichtsbibliotheken und das Bereitstellen von Modellen
- Erweiterung auf eine Konfiguration mit 4 Karten (Kentino AI 384 RTXPro6000 8000TOPS) — das Gehäuse bietet die nötige Steckplatzkapazität
- 24U-Rackschrank + Online-USV mit 5 kVA
Die Fragen, die uns Käufer vor der Bestellung eines Servers am häufigsten stellen.
Wie lange dauert es?
Maschinen aus Komponenten, die wir vorrätig haben, werden schnell versandt; alles, was eine bestimmte GPU-Generation erfordert, hängt von der Verfügbarkeit ab. Wir nennen Ihnen ein Datum, bevor Sie zahlen, und wenn es sich verschiebt, sagen wir es Ihnen, statt Sie es selbst herausfinden zu lassen.
Kann die Konfiguration vor dem Bau noch geändert werden?
Fast immer. GPUs, Arbeitsspeicher, Storage und Kühlung werden je Bestellung ausgewählt, und die angegebene Konfiguration ist ein Ausgangspunkt und kein festes Paket. Wenn Sie mehr VRAM, schnelleren Storage oder ein anderes Kühlkonzept benötigen, sagen Sie es vor der Bestellung – wir kalkulieren die Änderung.
Kann ich den Server persönlich abholen?
Das können Sie. Unser Lager befindet sich in Prag, und die persönliche Abholung ist willkommen – die meisten, die vorbeikommen, nutzen den Besuch, um die Maschine gemeinsam mit unserem Ingenieur durchzugehen und die Fragen zu stellen, die per E-Mail unangenehm sind. Bei Bestellungen innerhalb Tschechiens versuchen wir außerdem, persönlich zu liefern und Sie vor Ort durch die Einrichtung zu führen.
Kann ich mit jemandem sprechen, der den Workload wirklich versteht?
Ja. Bei uns arbeitet ein Ingenieur speziell an KI-Systemen, kein allgemeines Vertriebsteam. Wenn Ihre Frage Batch-Größen, Quantisierung, Interconnect oder die Frage betrifft, wo Ihr Engpass liegen wird, stellen Sie sie — dieses Gespräch verändert die Konfiguration meist zum Besseren.
Welches Modell kann ich auf dieser Konfiguration betreiben?
Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.
Wie testen Sie einen Server vor dem Versand?
Wir testen ihn mit echten KI-Workloads statt mit synthetischen Benchmarks: Inferenz-Durchsatz, Verhalten unter Dauerlast und Thermik im Dauerbetrieb. Die Benchmark-Ergebnisse erhalten Sie zusammen mit der Maschine, sodass Sie die zugesagte Leistung vom ersten Tag an selbst überprüfen können.
Ist der Server bei Lieferung betriebsbereit?
Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.
Versand aus unserem EU-Lager. Schwere Artikel erfordern unter Umständen eine Speditionslieferung — kontaktieren Sie uns für ein Versandangebot und die Lieferzeit. 2 Jahre eingeschränkte Garantie mit erweitertem RMA-Support; Garantieverlängerung verfügbar.
Nicht ganz das, was Sie brauchen?
Nennen Sie uns Ihren Workload, und wir legen diese Plattform darauf aus – GPUs, Arbeitsspeicher, Storage und Kühlung passend zu Ihrem tatsächlichen Betrieb.