Kentino KI 96 Rome RTXPro6000 2000TOPS — Single-Card 96 GB Blackwell Workstation-Server
Plattform in Enterprise-Qualität, in der EU montiert und getestet.
Kentino AI 96 Rome RTXPro6000 2000TOPS
96 GB ECC Single-Card Workstation-Server
1x RTX Pro 6000 Blackwell | EPYC Milan | 2 000 TOPS INT8
Eine Karte, 96 GB ECC-VRAM, die gesamte Blackwell-Tensor-Pipeline. 70B dense bf16 auf einer einzigen GPU — ohne Tensor-Parallel-Overhead.
Ein 4U-Workstation-Server für die Rackmontage mit einer einzelnen NVIDIA RTX Pro 6000 Blackwell Workstation (96 GB ECC GDDR7), einer AMD EPYC 7643 Milan CPU (48C/96T), 256 GB DDR4 ECC, 2 TB NVMe als Systemlaufwerk und einem 2-kW-ATX-Netzteil mit 54 % Reserve. Der einfachste Software-Weg im Kentino-Programm — keine Tensor-Parallel-Konfiguration, kein Multi-GPU-Debugging. vLLM, SGLang, llama.cpp und ComfyUI laufen auf einem einzigen Gerät und funktionieren einfach.
Hardware
| Komponente | Detail |
|---|---|
| GPU | 1x NVIDIA RTX Pro 6000 Blackwell Workstation 96 GB ECC GDDR7 (600 W, PCIe 5.0 x16) |
| VRAM | 96 GB ECC auf einer einzigen Karte — kein Pooling, kein Tensor-Parallel-Overhead |
| CPU | AMD EPYC 7643 Milan (48C/96T, 225 W, 128x PCIe 4.0 lanes) |
| Mainboard | ASRock Rack ROMED8-2T (SP3, 7x PCIe 4.0 x16, 8x DDR4 ECC, 2x 10 GbE, IPMI) |
| Arbeitsspeicher | 256 GB DDR4-2666 ECC RDIMM (4x 64 GB) |
| Systemlaufwerk / Speicher | 2 TB NVMe M.2 (PCIe 4.0 x4) |
| Netzteil | 1x 2-kW-ATX-Netzteil |
| Gehäuse | 4U für Rackmontage (Kapazität für 4 Steckplätze, 1 belegt — Raum zum Erweitern) |
| Kühlung | Arctic Freezer 4U-M SP3 Tower + 3x 120 mm Einlass vorne + 1x 120 mm Auslass hinten |
| Netzwerk | Onboard Dual 10 GbE (Intel X550) |
Leistungsbudget
- GPU-Aufnahme: 1 x 600 W = 600 W
- Systemgesamtleistung unter Volllast: ~925 W
- Netzteil gesamt: 2 000 W — 53.8 % Reserve
- Einzelnes Netzteil, einfache Verkabelung — großzügige Reserve für den Aufbau mit einer Karte
Lane-Topologie
PCIe Gen4 x16 an der GPU (die Karte ist nativ Gen5; das Rome-Board begrenzt auf Gen4). Direkte Anbindung an den Root Complex — kein PCIe-Switch. Kein NVLink erforderlich — eine einzige Karte, also gar keine Verbindung zwischen GPUs. Sechs x16-Steckplätze bleiben frei für NIC / Storage / Erweiterungen.
Was Sie betreiben können
Mit 96 GB ECC-VRAM auf einer einzigen Blackwell-Karte bewältigt dieser Server 70B dense bf16 auf einer GPU, LLMs mit offenen Gewichten, Vision-Modelle, Bild- und Videogenerierung, Sprach-KI und Inferenz im Produktivbetrieb — ganz ohne Tensor-Parallel-Koordination.
LLMs — Text / Reasoning / Coding
Chinesische Spitzenmodelle
- Qwen3 / Qwen3.5 (Alibaba): Qwen3-32B dense bf16 (~65 GB) mit großzügigem KV; Qwen3-72B Q6 (~58 GB, ~25-35 tok/s im Einzelstrom); Qwen3-30B-A3B MoE bf16; Qwen3-Coder-30B-A3B agentisch bei 256k ctx; Qwen3.5-122B-A10B Q4 (~70 GB) mit knappem KV; QwQ-32B bf16 Reasoning
- DeepSeek: DeepSeek-R2 32B sparse MoE bf16 (~64 GB, 92.7 % AIME 2025 auf einer Karte); DeepSeek-R1-Distill-Qwen-32B bf16; DeepSeek-V2-Lite 16B in voller Präzision
- GLM / Z.ai: GLM-4.5-Air 106B/12B Q4-Q5 (60-70 GB); GLM-4.6V 106B Q4
- Tencent Hunyuan: Hunyuan-A13B 80B/13B MoE Q4-fp8 (~48-80 GB) mit 256k ctx und Reasoning im Dual-Modus
- ByteDance Seed-OSS-36B bf16 (~72 GB, knapp) oder fp8 (~36 GB) mit vollen 512k nativem Kontext
- Baidu ERNIE-4.5-47B-A3B Q4-fp8 mit langem Kontext
Westliche Spitzenmodelle
- Meta Llama: Llama 3.3 70B in bf16 (~70 GB) auf einer einzigen Karte mit 8-16k ctx — die Paradekonfiguration; Llama 3.3 70B Q6 (~58 GB, ~35-50 tok/s im Einzelstrom); Llama 3.1 8B bf16 (~80-120 tok/s); Llama 3.2 90B Vision Q4 (~52 GB); Llama 4 Scout 109B/17B MoE Q4 (~63 GB)
- Mistral: Mistral Small 3 / Magistral Small 1.2 / Devstral Small 2 (24B) allesamt in bf16 mit 256k ctx; Mixtral 8x7B Q6; Codestral Mamba 7B; Pixtral 12B bf16
- OpenAI (offene Gewichte): gpt-oss-20b MXFP4 nativ (16 GB); gpt-oss-120b MXFP4 nativ (80 GB) — eine Karte, ein Strom
- Google Gemma 3: 27B multimodal bf16 (~54 GB) mit 128k ctx; 12B / 4B bf16
- Microsoft Phi-4 14B dense bf16; Phi-4-reasoning; Phi-4-multimodal
- NVIDIA Nemotron: Llama-3.1-Nemotron-Super 49B Q6 (~40 GB); Nemotron-Nano 8B
- Weitere: IBM Granite 4.0 H-Small 32B/9B; OLMo 2 32B; Reka Flash 3 21B; Falcon H1R 7B; Command R 35B
Vision-Language-Modelle
Qwen3-VL-8B / 32B bf16, Qwen3-VL-30B-A3B MoE bf16, Qwen3-Omni-30B-A3B; InternVL3 bis 78B Q4 (~48 GB); InternVL3.5-38B bf16; DeepSeek-VL2 in voller Bandbreite; Llama 3.2 11B Vision bf16; Llama 3.2 90B Vision Q4 (~52 GB); Pixtral 12B bf16; Molmo 72B Q4; Molmo 7B bf16; Gemma 3 12B / 27B multimodal; PaliGemma 2 28B; Phi-3.5-Vision; Aya Vision 8B / 32B; MiniCPM-V 2.6 / MiniCPM-o 2.6; GLM-4.6V.
Bildgenerierung
FLUX.1 [dev] / [schnell] bf16 (~24 GB) und quantisiert (~15-25 s/Bild bei fp8); FLUX.1 Kontext [dev] für Bearbeitung im Kontext; FLUX Tools (Fill / Depth / Canny / Redux); SD 3.5 Large bf16 (~18 GB); SDXL 1.0; HunyuanImage-2.1 bf16 (~34 GB) nativ in 2K; HunyuanDiT 1.5B; Kolors / Kolors 2.0; AuraFlow v0.3; OmniGen v1; PixArt-Sigma.
Videogenerierung
Wan 2.2 T2V-A14B / I2V-A14B MoE bf16 (~54 GB, beide Experten resident); Wan 2.2 TI2V-5B als schneller Pfad; HunyuanVideo 13B bf16 (~60-80 GB, knapp bei 720p); HunyuanVideo 1.5 (8.3B); CogVideoX-5B; Open-Sora 2.0 (11B) bf16; Genmo Mochi-1 bf16 (~42 GB); LTX-Video; Pyramid Flow; SVD / SV3D / SV4D; NVIDIA Cosmos Predict 2.
Audio / Sprache / TTS
- ASR: Whisper v3 large / turbo (~50x Echtzeit); NVIDIA Parakeet-TDT 1.1B; Canary 1B; Qwen3-ASR; SenseVoice
- TTS: CosyVoice 2 / Fun-CosyVoice 3.0; Kokoro 82M; Stable Audio Open; Coqui XTTS v2; StyleTTS 2; Step-Audio-EditX
- Realtime / S2S: Kyutai Moshi (200 ms Vollduplex); Step-Audio 2 mini; Step-Audio-R1 / R1.1; Qwen2.5-Omni-7B
- Musik / SFX: Meta MusicGen; AudioGen; Suno Bark; SeamlessM4T v2
Multi-Modell- / Multi-Tenant-Betrieb
- Streaming-Coding-Assistent für einen einzelnen Mandanten — 70B dense bf16, geringe Latenz, kein TP-Aufschlag
- Gemischter residenter Stack: Qwen3-32B bf16 + FLUX.1 fp8 + Whisper-turbo + Moshi auf einer Karte mit partitioniertem VRAM
- Fine-Tuning: LoRA / QLoRA bei Modellen von 13-34B; Full-Parameter bei 7B
- Embedding-Dienst: BGE-M3 / E5 / Jina resident neben einem generierenden LLM
Zielanwendungen
- Streaming-Coding-Assistent für einen einzelnen Mandanten mit Llama 3.3 70B bf16 oder Qwen3-Coder-30B-A3B — ohne Koordinationsaufwand für TP
- Entwickler-Workstation für einen einzelnen Ingenieur oder ein kleines Team, das ein Modell der 70B-Klasse mit 32-128k Kontext benötigt
- Labor für Video- oder Bildgenerierung — HunyuanVideo 13B, Wan 2.2 mit zwei Experten und HunyuanImage-2.1 allesamt resident in bf16
- VLM- / OCR-Prüfstand — Qwen3-VL-32B bf16 oder InternVL3.5-38B mit Pipelines für lange Dokumente
- Schlanke Appliance für ein kleines LLM-API-Gateway — ein Modell, eine Karte, einfacher Betrieb
Gemessene Leistung
Veröffentlichte Quellen | NVIDIA RTX Pro 6000 Blackwell Datenblatt + Community-Benchmarks
| Benchmark | Ergebnis |
|---|---|
| INT8 TOPS je Karte (NVIDIA Datenblatt) | 2 000 TOPS |
| VRAM je Karte | 96 GB ECC GDDR7 |
| Speicherbandbreite | ~1 800 GB/s |
| Llama 3.3 70B Q6 auf einer GPU (Community) | 40-55 tok/s im Einzelstrom |
| Llama 3.3 70B bf16 auf einer GPU (Community) | 15-25 tok/s im Einzelstrom |
| Blackwell fp8 nativ | DeepSeek-V3 fp8 und Hunyuan-A13B fp8 laufen ohne Upcast auf bf16 |
Veröffentlichte externe Quellen, nicht auf Kentino-Hardware gemessen. Kentino veröffentlicht eigene Messwerte nach dem ersten Kundensystem.
Weniger geeignet für
- Das Training großer Modelle von Grund auf (eine einzige GPU — keine Tensor- oder Pipeline-Parallelität)
- Spitzen-MoE ab 200B bei realistischen Quantisierungen (Qwen3-235B Q4, GLM-4.5/4.6 — verwenden Sie Kentino AI 192 RTXPro6000 oder größer)
- Multi-Tenant-Inferenz mit hoher Parallelität (eine einzelne Karte begrenzt den Gesamtdurchsatz; 4x RTX 4090 oder 4x L40 skalieren besser)
Garantie und Lieferzeit
3 Jahre NVIDIA OEM-Garantie auf die RTX Pro 6000 + Kentino-Integrationsgarantie. Im Aufbau enthalten sind Montage, BIOS-Konfiguration, Treiberinstallation, Burn-in-Test und Funktionsprüfung. Die Lieferzeit hängt von der Verfügbarkeit der Komponenten ab und wird bei Bestellung bestätigt.
Empfohlenes Zubehör
- Arbeitsspeicher auf 512 GB erweitern (4x 64 GB DDR4 ergänzen — vier DIMM-Steckplätze sind noch frei)
- 4 TB NVMe als Zweitlaufwerk für Modellbibliothek / Datensatz-Bereitstellung
- 24U offener Schrank für die Rackmontage im Produktivbetrieb
- Für Gen5-x16-Anbindung ist auf Anfrage die Genoa-Plattformvariante erhältlich
Die Fragen, die uns Käufer vor der Bestellung eines Servers am häufigsten stellen.
Wie lange dauert es?
Maschinen aus Komponenten, die wir vorrätig haben, werden schnell versandt; alles, was eine bestimmte GPU-Generation erfordert, hängt von der Verfügbarkeit ab. Wir nennen Ihnen ein Datum, bevor Sie zahlen, und wenn es sich verschiebt, sagen wir es Ihnen, statt Sie es selbst herausfinden zu lassen.
Kann die Konfiguration vor dem Bau noch geändert werden?
Fast immer. GPUs, Arbeitsspeicher, Storage und Kühlung werden je Bestellung ausgewählt, und die angegebene Konfiguration ist ein Ausgangspunkt und kein festes Paket. Wenn Sie mehr VRAM, schnelleren Storage oder ein anderes Kühlkonzept benötigen, sagen Sie es vor der Bestellung – wir kalkulieren die Änderung.
Kann ich den Server persönlich abholen?
Das können Sie. Unser Lager befindet sich in Prag, und die persönliche Abholung ist willkommen – die meisten, die vorbeikommen, nutzen den Besuch, um die Maschine gemeinsam mit unserem Ingenieur durchzugehen und die Fragen zu stellen, die per E-Mail unangenehm sind. Bei Bestellungen innerhalb Tschechiens versuchen wir außerdem, persönlich zu liefern und Sie vor Ort durch die Einrichtung zu führen.
Kann ich mit jemandem sprechen, der den Workload wirklich versteht?
Ja. Bei uns arbeitet ein Ingenieur speziell an KI-Systemen, kein allgemeines Vertriebsteam. Wenn Ihre Frage Batch-Größen, Quantisierung, Interconnect oder die Frage betrifft, wo Ihr Engpass liegen wird, stellen Sie sie — dieses Gespräch verändert die Konfiguration meist zum Besseren.
Welches Modell kann ich auf dieser Konfiguration betreiben?
Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.
Wie testen Sie einen Server vor dem Versand?
Wir testen ihn mit echten KI-Workloads statt mit synthetischen Benchmarks: Inferenz-Durchsatz, Verhalten unter Dauerlast und Thermik im Dauerbetrieb. Die Benchmark-Ergebnisse erhalten Sie zusammen mit der Maschine, sodass Sie die zugesagte Leistung vom ersten Tag an selbst überprüfen können.
Ist der Server bei Lieferung betriebsbereit?
Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.
Versand aus unserem EU-Lager. Schwere Artikel erfordern unter Umständen eine Speditionslieferung — kontaktieren Sie uns für ein Versandangebot und die Lieferzeit. 2 Jahre eingeschränkte Garantie mit erweitertem RMA-Support; Garantieverlängerung verfügbar.
Nicht ganz das, was Sie brauchen?
Nennen Sie uns Ihren Workload, und wir legen diese Plattform darauf aus – GPUs, Arbeitsspeicher, Storage und Kühlung passend zu Ihrem tatsächlichen Betrieb.