Kentino KI 192 Turin2U RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — 2U Turin SP5
Kentino KI 192 Turin2U RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — 2U Turin SP5
Kentino KI 192 Turin2U RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — 2U Turin SP5
Kentino KI 192 Turin2U RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — 2U Turin SP5
Kentino KI 192 Turin2U RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — 2U Turin SP5
Kentino KI 192 Turin2U RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — 2U Turin SP5
Kentino KI 192 Turin2U RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — 2U Turin SP5
Kentino KI 192 Turin2U RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — 2U Turin SP5
Kentino KI 192 Turin2U RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — 2U Turin SP5
Kentino · Individueller KI-Server

Kentino KI 192 Turin2U RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — 2U Turin SP5

Plattform in Enterprise-Qualität, in der EU montiert und getestet.

€56.600,00 zzgl. MwSt. · Versand an der Kasse berechnet
Auf Lager — Versand aus dem EU-Lager
ISO 9001 · geprüfte HardwareEU-Lager & Garantie7+ Jahre in Enterprise-KIBurn-in-getestet vor dem Versand
Übersicht
FAQ
Versand & Garantie

Kentino AI 192 Turin2U RTXPro6000 4000TOPS

192 GB ECC Blackwell Flaggschiff-Duo
2x RTX Pro 6000 Server Edition | EPYC Turin SP5 | 4 000 TOPS INT8

4 000
INT8 TOPS
192 GB
ECC VRAM
Blackwell
fp8 nativ
2 Karten
minimales TP

Zwei passive Karten vom Typ RTX Pro 6000 Blackwell Server Edition -- je 96 GB ECC. Deutlich weniger Tensor-Parallel-Overhead als bei Systemen mit 4 oder 8 Karten. Ein Flaggschiff-Duo für Rechenzentren auf einer Gen5/DDR5-2U-Plattform mit echter 1+1-redundanter Stromversorgung.

Ein 2U-Rack-Inferenzserver mit zwei passiven Karten vom Typ RTX Pro 6000 Blackwell Server Edition (96 GB ECC GDDR7 je Karte), einer AMD EPYC 9335 Turin CPU (32C/64T, 3.0/4.4 GHz), 512 GB DDR5-4800 ECC, 5.76 TB Rechenzentrums-NVMe der Gen5 sowie einem 1+1-redundanten 2.7 kW 80+ Platinum CRPS Netzteil. Ab €56 600 zzgl. MwSt. Für dichte 70B-Modelle in bf16 und mittelgroße MoE gilt: Wenige große Karten schlagen viele kleine -- die Tensor-Parallelität über zwei Karten verursacht minimalen Kommunikations-Overhead, und jede 96-GB-Karte fasst eine vollständige Kopie der meisten Modelle.

Dasselbe 192-GB-Blackwell-Duo wie in unserem 4U-Rome-Build, jedoch in einem rack-dichten 2U-ASRock-Gehäuse mit durchgängigem Gen5 auf Host-Seite, DDR5-4800-Speicher und einem echten 1+1-redundanten 2.7 kW Platinum CRPS Netzteil. Wählen Sie diesen Build, wenn Rackdichte zählt, wenn Ihre Förderrichtlinie oder Ausschreibung eine moderne PCIe-5.0-/DDR5-Plattform vorschreibt oder wenn redundante Stromversorgung Pflicht und nicht bloß ein Upsell ist.

Hardware

Komponente Detail
GPUs 2x NVIDIA RTX Pro 6000 Blackwell Server Edition 96 GB ECC GDDR7 (passiv, 600 W, PCIe 5.0 x16, Dual-Slot)
VRAM-Pool 192 GB ECC (96 GB x 2) -- jede Karte fasst ein 70B-bf16-Modell allein
CPU AMD EPYC 9335 Turin (32C/64T, 3.0/4.4 GHz, 210 W, SP5, 128x PCIe 5.0 Lanes, Zen5c, 256 MB L3)
Mainboard ASRock Rack 2U4G-GENOA/M3 (SP5, 4x PCIe 5.0 x16 Dual-Slot GPU, 8x DDR5 1DPC, OCP 3.0, IPMI AST2600)
Arbeitsspeicher 512 GB DDR5-4800 ECC RDIMM (8x 64 GB, 1DPC voll bestückt -- Konfiguration für maximale Bandbreite)
Boot / Speicher Kioxia CD8-P 3.84 TB Gen5 U.3 (Hot-Tier, 1 DWPD, ~12 GB/s lesend) + Kioxia CD8-P 1.92 TB Gen5 U.3 (Boot-/OS-Tier) -- insgesamt 5.76 TB Rechenzentrums-NVMe der Gen5
Netzteil 1+1-redundant, 2.7 kW 80+ Platinum CRPS (2x 1350 W bei 230 V) -- echte N+1-Redundanz; ein Netzteil trägt die volle Inferenzlast
Gehäuse 2U-Rackgehäuse mit gerichtetem Luftstrom von vorne nach hinten (80 mm Lüfter mit hohem statischem Druck). 24/7-tauglich.
Kühlung Aktiver SP5-CPU-Kühler + 3x 80x38 mm Einlasslüfter vorne + 1x 80x80 mm Auslasslüfter hinten (ausgelegt für die thermische Last von 4 passiven GPUs; das 2-Karten-Layout bietet reichlich thermische Reserve)
Netzwerk Intel X710-T2L PCIe dual 10GBASE-T + freier OCP-3.0-Steckplatz für ein Upgrade auf 25/100 GbE

Leistungsbudget

  • GPU-Aufnahme: 2x 600 W = 1 200 W
  • Systemgesamtleistung unter Volllast: ~1 510 W
  • Netzteilkonfiguration: 1+1-redundant CRPS, 2x 1350 W bei 230 V (insgesamt 2 700 W)
  • Reserve: 44.1 % bei typischer Inferenzlast
  • Echte N+1-Redundanz -- ein Netzteil trägt die volle Inferenzlast; kein Ausfallrisiko durch ein einzelnes Netzteil

Lane-Topologie

PCIe Gen5 x16 durchgängig -- Host und Karte nativ Gen5. Direkte Anbindung an den Root Complex, ohne PCIe-Switch. Ein PCIe 5.0 x16 Single-Slot und ein PCIe 5.0 x8 Steckplatz bleiben frei (die Netzwerkkarte belegt den x8-Steckplatz). Kein NVLink -- Peer-to-Peer zwischen den GPUs läuft über PCIe. Die Gen5-Bandbreite beseitigt die Gen4-Host-Begrenzung des 4U-Rome-Schwestermodells.

Was Sie damit betreiben können

Mit 192 GB ECC-VRAM auf nur zwei Blackwell-Karten mit nativem fp8/fp4 ist dies der sauberste Weg zu dichten 70B-Modellen in bf16 und mittelgroßen MoE. Zwei unabhängige 70B-Streams -- einer pro Karte -- oder 200B MoE über beide Karten mit minimalem Overhead der 2-Wege-Tensor-Parallelität.

LLMs -- Text / Reasoning / Coding

Chinesische Spitzenmodelle

  • Qwen3 / Qwen3.5 (Alibaba): Qwen3-235B-A22B Q4 (~132 GB) komfortabel mit langem Kontext (~15-25 Token/s Single-Stream über 2 Karten); Qwen3-Coder-480B-A35B Q2 (~160 GB); Qwen3.5-122B-A10B fp8 (~75 GB); Qwen3-32B dense bf16 mit riesigem KV; QwQ-32B bf16
  • DeepSeek: DeepSeek-V3/R1 Q2 (~215 GB mit geringem RAM-Überlauf) -- Blackwell verarbeitet fp8 nativ; DeepSeek-R2 32B bf16 in zwei gleichzeitigen Streams (einer pro Karte)
  • GLM / Z.ai: GLM-4.5 / 4.6 / 4.7 Q4 (~177 GB) -- die Paradekonfiguration dieser Klasse; GLM-4.5-Air fp8 oder bf16 mit riesigem KV
  • Tencent Hunyuan: Hunyuan-Large Q3 (~160 GB) -- 389B MoE mit 256k Kontext; Hunyuan-A13B fp8 nativ (~80 GB) mit riesigem KV
  • Weitere: Baidu ERNIE-4.5-424B Q3 (~180 GB); InternVL3.5-241B-A28B Q4 (~135 GB); MiniMax-M1 Q3 (~180 GB)

Westliche Spitzenmodelle

  • Meta Llama: Llama 3.3 70B bf16 auf einer Karte -- zwei unabhängige, gleichzeitige 70B-Streams (~20-30 Token/s je Stream); Llama 4 Scout bf16 (~218 GB, knapp); Llama 4 Maverick Q3 (~188 GB)
  • Mistral: Mistral Large 2 / Pixtral Large / Devstral 2 123B Q6 (~88 GB) auf einer Karte oder bf16 über beide; Mistral Small 3 im Multi-Stream-Betrieb
  • OpenAI (offene Gewichte): gpt-oss-120b MXFP4 nativ (80 GB) -- passt auf EINE Karte, zwei unabhängige gleichzeitige Streams
  • NVIDIA Nemotron: Llama-3.1-Nemotron Ultra 253B Q4 (~147 GB); Super 49B bf16 auf einer einzelnen Karte
  • Weitere: Cohere Command R+ 104B Q6 (~85 GB) auf einer Karte; Google Gemma 3 27B bf16 in mehreren gleichzeitigen Streams

Vision-Language-Modelle

InternVL3.5-241B-A28B Q4 (~135 GB); Qwen3-VL-235B-A22B Q4; Qwen3-VL-32B bf16 auf einer Karte; Pixtral Large 124B bf16 oder Q6; Llama 3.2 90B Vision bf16 (~180 GB); Molmo 72B bf16 (~144 GB); GLM-4.6V 106B fp8; Gemma 3 27B multimodal x 2-3 gleichzeitige Streams.

Bildgenerierung

FLUX.1 [dev] bf16 in mehreren gleichzeitigen Streams; FLUX.1 Kontext [dev]; FLUX Tools; SD 3.5 Large bf16 gleichzeitig; HunyuanImage-2.1 bf16 (~34 GB) x 2-4 gleichzeitig; HunyuanImage-3.0 Base (80B MoE, 13B aktiv) bf16 -- passt auf eine Karte; HunyuanDiT; Kolors / Kolors 2.0; AuraFlow; OmniGen v1; PixArt-Sigma.

Videogenerierung

Wan 2.2 MoE Dual-Expert bf16 mit vollem Kontext -- passt auf eine Karte, zwei gleichzeitige Generierungs-Streams; Wan 2.2 TI2V-5B; HunyuanVideo 13B bf16 mit beiden Experten; HunyuanVideo 1.5; CogVideoX-5B bf16; Open-Sora 2.0 11B bf16; Mochi-1 bf16 (~42 GB); LTX-Video; Pyramid Flow; SVD / SV3D / SV4D; NVIDIA Cosmos Predict 2.

Audio / Sprache / TTS

  • ASR: Whisper v3 large / turbo (~50x Echtzeit); Parakeet-TDT; Canary 1B; Qwen3-ASR; SenseVoice
  • TTS: CosyVoice 2/3; Kokoro 82M; XTTS v2; Stable Audio Open; Step-Audio-EditX
  • Echtzeit / S2S: Kyutai Moshi 7B; Step-Audio 2 mini/R1; Qwen2.5-Omni-7B
  • Musik / SFX: MusicGen / AudioGen / Bark; SeamlessM4T v2

Multi-Modell- / Multi-Tenant-Serving

  • Zwei unabhängige 70B-Streams -- einer pro Karte, die einfachste Form der Mandantentrennung
  • Dichtes 70B in bf16 plus ergänzender Stack -- LLM auf Karte 1, Bild/Video/Audio auf Karte 2
  • 200B MoE über beide Karten -- minimaler Tensor-Parallel-Overhead (Aufteilung auf 2 Wege)
  • fp8-native Spitzenmodelle -- DeepSeek-V3-Familie, Hunyuan-Large fp8 über die nativen Blackwell-Pfade

Ziel-Workloads

  • Inferenz dichter 70B-Modelle in bf16 -- zwei Karten tensor-parallel mit minimalem Overhead oder ein Modell je Karte für Streaming
  • 100-150B MoE bei Q4-Q6 (GLM-4.5-Air, Qwen3.5-122B-A10B, Hunyuan-A13B, Llama 4 Scout)
  • FP8-native Spitzeninferenz (DeepSeek-V3-Familie, Hunyuan, Llama 4) -- Blackwell verarbeitet fp8 nativ
  • Wissenschaftliches Rechnen mit Bedarf an Gen5-NVMe-Durchsatz in Rechenzentrumsqualität und ECC-Speicher
  • Studio für Bild- und Videogenerierung in bf16 (Wan 2.2 T2V-A14B, HunyuanVideo 13B, FLUX.1 [dev])
  • Deployments mit begrenzter Rackdichte -- 2U-Formfaktor statt des 4U-Rome-Pendants bei gleichem VRAM
  • Ausschreibungen, die eine PCIe-5.0-/DDR5-Plattform oder ein redundantes Netzteil vorschreiben

Gemessene Leistung

Veröffentlichte Quellen | Datenblatt der NVIDIA RTX Pro 6000 Blackwell Server Edition + Community-Benchmarks

Benchmark Ergebnis
INT8 TOPS je Karte (NVIDIA-Datenblatt) 2 000 TOPS
INT8 TOPS gesamt (2 Karten) 4 000 TOPS
Speicherbandbreite je Karte ~1 800 GB/s, 96 GB ECC GDDR7
Llama 3.3 70B bf16 je Karte (Community) 15-25 Token/s Single-Stream, 60-90 Token/s im Batch -- bei Streaming-Batch-Workloads ist gegenüber einem Gen4-Host eine Verbesserung durch den Gen5-Speicherpfad auf Host-Seite zu erwarten
Vorteil von Gen5 auf Host-Seite (einzelne Karte, gleicher Chip) Durchgängiges PCIe 5.0 x16 senkt die Übertragungslatenz zwischen Host und Gerät bei Streaming-Batch-Workloads; rein rechenlastige Aufgaben auf der Karte erreichen denselben Durchsatz wie bei Gen4-Hosts
70B tensor-parallel über zwei Karten (Community) ~30-45 Token/s Single-Stream zu erwarten
Blackwell fp8 nativ DeepSeek-V3 fp8 und Hunyuan-A13B fp8 laufen ohne Upcast auf bf16

Veröffentlichte externe Quellen, nicht auf Kentino-Hardware gemessen. Kentino veröffentlicht eigene Messwerte nach dem ersten Kundenaufbau.

Weniger geeignet für

  • Multi-Tenant-Serving mit sehr hoher Parallelität -- 4x L40 oder 6x L4 verteilen die Last besser auf mehr Karten
  • Großer KV-Cache bei sehr langem Kontext -- greifen Sie hier zum Kentino AI 576 Genoa RTXPro6000 12000TOPS
  • Training -- Kentino vertreibt keine NVLink-Fabrics der H-Klasse
  • Günstige Inferenz bei diesem VRAM-Pool -- der 4U-Rome-Build Kentino AI 192 RTXPro6000 4000TOPS ist preiswerter, sofern Gen4 auf Host-Seite genügt und keine Netzteilredundanz gefordert ist

Garantie und Lieferzeit

2 Jahre
Garantie auf Teile
1 Jahr
Garantie auf Arbeitsleistung
14-21 Tage
Lieferzeit

3 Jahre NVIDIA-OEM-Garantie auf die RTX Pro 6000 Server Edition + 36 Monate Garantie auf das Gehäuse + Kentino-Integrationsgarantie. Im Lieferumfang enthalten sind Montage, BIOS-/Firmware-Konfiguration, IPMI-Einrichtung, Treiberinstallation, Burn-in-Test und Funktionsprüfung. Die Lieferzeit von 14-21 Werktagen ergibt sich aus der Bestellung der Turin-Komponenten beim Distributor; sie wird bei Auftragserteilung bestätigt.

Empfohlenes Zubehör

  • Erweiterung auf eine 4-Karten-Konfiguration -- das Gehäuse bietet von Haus aus 4 GPU-Schächte (der aktuelle Build nutzt 2 von 4), Upgrade-Pfad zum Kentino AI 384 Turin2U RTXPro6000 8000TOPS
  • Nachrüstung von 25 GbE oder 100 GbE über den OCP-3.0-Steckplatz (Mellanox ConnectX-5/6 in der OCP-Variante)
  • Weitere Kioxia CD8-P NVMe in den 2 verbleibenden U.2-Schächten für RAID oder Scratch-Speicher
  • Upgrade des Speicher-Tiers auf Samsung PM1743 oder Kioxia CM7-V für höhere Haltbarkeit (3 DWPD)
  • 24U-Rackschrank + Online-USV 5 kVA

Die Fragen, die uns Käufer vor der Bestellung eines Servers am häufigsten stellen.

Wie lange dauert es?

Maschinen aus Komponenten, die wir vorrätig haben, werden schnell versandt; alles, was eine bestimmte GPU-Generation erfordert, hängt von der Verfügbarkeit ab. Wir nennen Ihnen ein Datum, bevor Sie zahlen, und wenn es sich verschiebt, sagen wir es Ihnen, statt Sie es selbst herausfinden zu lassen.

Kann die Konfiguration vor dem Bau noch geändert werden?

Fast immer. GPUs, Arbeitsspeicher, Storage und Kühlung werden je Bestellung ausgewählt, und die angegebene Konfiguration ist ein Ausgangspunkt und kein festes Paket. Wenn Sie mehr VRAM, schnelleren Storage oder ein anderes Kühlkonzept benötigen, sagen Sie es vor der Bestellung – wir kalkulieren die Änderung.

Kann ich den Server persönlich abholen?

Das können Sie. Unser Lager befindet sich in Prag, und die persönliche Abholung ist willkommen – die meisten, die vorbeikommen, nutzen den Besuch, um die Maschine gemeinsam mit unserem Ingenieur durchzugehen und die Fragen zu stellen, die per E-Mail unangenehm sind. Bei Bestellungen innerhalb Tschechiens versuchen wir außerdem, persönlich zu liefern und Sie vor Ort durch die Einrichtung zu führen.

Kann ich mit jemandem sprechen, der den Workload wirklich versteht?

Ja. Bei uns arbeitet ein Ingenieur speziell an KI-Systemen, kein allgemeines Vertriebsteam. Wenn Ihre Frage Batch-Größen, Quantisierung, Interconnect oder die Frage betrifft, wo Ihr Engpass liegen wird, stellen Sie sie — dieses Gespräch verändert die Konfiguration meist zum Besseren.

Welches Modell kann ich auf dieser Konfiguration betreiben?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Wie testen Sie einen Server vor dem Versand?

Wir testen ihn mit echten KI-Workloads statt mit synthetischen Benchmarks: Inferenz-Durchsatz, Verhalten unter Dauerlast und Thermik im Dauerbetrieb. Die Benchmark-Ergebnisse erhalten Sie zusammen mit der Maschine, sodass Sie die zugesagte Leistung vom ersten Tag an selbst überprüfen können.

Ist der Server bei Lieferung betriebsbereit?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Versand aus unserem EU-Lager. Schwere Artikel erfordern unter Umständen eine Speditionslieferung — kontaktieren Sie uns für ein Versandangebot und die Lieferzeit. 2 Jahre eingeschränkte Garantie mit erweitertem RMA-Support; Garantieverlängerung verfügbar.

Nicht ganz das, was Sie brauchen?

Nennen Sie uns Ihren Workload, und wir legen diese Plattform darauf aus – GPUs, Arbeitsspeicher, Storage und Kühlung passend zu Ihrem tatsächlichen Betrieb.