Kentino KI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q KI Frontier-Server
Kentino KI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q KI Frontier-Server
Kentino KI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q KI Frontier-Server
Kentino KI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q KI Frontier-Server
Kentino KI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q KI Frontier-Server
Kentino KI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q KI Frontier-Server
Kentino KI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q KI Frontier-Server
Kentino KI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q KI Frontier-Server
Kentino · Individueller KI-Server

Kentino KI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q KI Frontier-Server

Plattform in Enterprise-Qualität, in der EU montiert und getestet.

€110.023,00 zzgl. MwSt. · Versand an der Kasse berechnet
Auf Lager — Versand aus dem EU-Lager
ISO 9001 · geprüfte HardwareEU-Lager & Garantie7+ Jahre in Enterprise-KIBurn-in-getestet vor dem Versand
Übersicht
FAQ
Versand & Garantie

Kentino AI 576 Genoa RTXPro6000MQ 12000TOPS

Frontier-Server mit 576 GB ECC-VRAM
6x RTX Pro 6000 Max-Q Turbofan | EPYC Genoa | 12 000 TOPS INT8

12 000
TOPS INT8
576 GB
ECC-VRAM-Pool
Gen5
Broadcom-Switch
Leise
Turbofan-Kühlung

Veröffentlichte externe Referenzwerte. Nicht auf Kentino-Hardware gemessen.

Eine 7U-Rack-Inferenzplattform der Frontier-Klasse mit sechs NVIDIA RTX Pro 6000 Blackwell Max-Q Turbofan-Karten, zusammengefasst zu 576 GB ECC-VRAM, einer AMD EPYC 9354 Genoa CPU (32C/64T), 768 GB DDR5-4800 ECC (alle 12 Kanäle bestückt), 4 TB NVMe als Boot-Laufwerk und 5x 1200 W Server-Netzteilen. Gleiches Silizium und gleicher Speicherpool wie der passive Aufbau der Server Edition — nur mit anderer Kühlung. Der Max-Q-Turbofan arbeitet pro Karte autark, läuft leiser und stellt geringere Anforderungen an den Luftstrom im Gehäuse. Das Modellspektrum ist identisch mit dem der passiven Schwestervariante.

Hardware

Komponente Details
GPUs 6x NVIDIA RTX Pro 6000 Blackwell Max-Q 96 GB ECC (Turbofan-Radiallüfter, 600 W TDP laut Spezifikation, PCIe 5.0 x16, 2000 INT8 TOPS pro Karte)
VRAM-Pool 576 GB gesamt über 6 Karten (kein NVLink — P2P über PCIe Gen5 mit ~55-60 GB/s je Richtung)
CPU AMD EPYC 9354 Genoa (32C/64T, 280 W, 128x PCIe-5.0-Lanes, 12-Kanal-DDR5)
Mainboard ASRock Rack GENOAD8X-2T/BCM (SP5 Genoa, integrierter Broadcom-PEX-PCIe-Gen5-Switch, 12x DDR5, 2x 10 GbE, IPMI)
Arbeitsspeicher 768 GB DDR5-4800 ECC RDIMM (12x 64 GB — alle Kanäle bestückt, ~460 GB/s gesamt)
Boot / Speicher 4 TB NVMe M.2 (PCIe 4.0 x4) — dimensioniert für das Staging von Frontier-Checkpoints
Netzteil Set aus 5x 1200 W Server-Netzteilen (HP-kompatibel, 6 kW gesamt)
Gehäuse 7U-Rackgehäuse für 8 GPUs, Platz für 10 PCIe-Steckplätze, aktive Gen5-Riser
Kühlung SP5-Genoa-Tower-Kühler + 8x 120 mm Gehäuselüfter. Die Turbofan-Radiallüfter je GPU arbeiten autark — Rechenzentrums-Luftstrom wird empfohlen, ist aber nicht zwingend erforderlich. Leiser für Laborumgebungen.
Netzwerk Onboard Dual-10-GbE (Intel X550)

Leistungsbudget

  • GPU-Aufnahme (laut Spezifikation): 6 x 600 W = 3 600 W
  • Systemgesamtleistung bei spezifizierter Volllast: ~4 080 W
  • Netzteilleistung gesamt: 6 000 W (5x 1200 W) — 32% Reserve
  • Max-Q-Karten laufen dauerhaft typischerweise mit 520-550 W — in der Praxis über 20% Reserve

Kühlung (der Max-Q-Unterschied)

Jede Karte zieht die Luft über einen eigenen Radiallüfter von vorne nach hinten — pro Karte autark. Geeignet für gemischt bestückte Racks und offene Schränke. Leiser als ein vergleichbarer Aufbau mit Axiallüftern. Das Max-Q-Firmware-Profil bevorzugt eine niedrigere Dauerleistung (typisch 520-550 W bei Inferenz). Empfohlen: Schrank mit perforierter Fronttür und freiem Abluftweg nach hinten.

Was Sie darauf betreiben können

Identisch mit der Schwestervariante Server Edition — gleiches Silizium, gleicher 576-GB-Pool. DeepSeek V3 Q4 (~404 GB) mit langem Kontext, Kimi-K2 Q2, Mistral Large 3 Q2-Q3, GLM-5 Q2, Qwen3-Coder-480B Q4.

LLMs — Text / Reasoning / Coding

Chinesische Frontier-Modelle

  • DeepSeek V3 / R1 / V3.1 / V3.2 in Q4_K_M (~404 GB) komfortabel mit langem Kontext (~5-8 tok/s einzeln, vLLM TP-6, veröffentlichte Referenz); fp8 nativ (~670 GB) mit Auslagerung in den RAM
  • Kimi-K2 (Base / Instruct / Thinking) in Q2_K (~375 GB) komfortabel (~5-8 tok/s einzeln, veröffentlichte Referenz)
  • GLM-5 / GLM-5.1 (~745B/44B) in Q2_K (~260 GB); Q3 (~420 GB) mit Auslagerung in den RAM
  • Qwen3-Coder-480B-A35B in Q4_K_M (~270 GB) mit langem Kontext
  • Qwen3-235B-A22B in bf16 (~470 GB) oder fp8 (~240 GB)
  • ERNIE-4.5-424B-A47B in Q4 (~240 GB) mit 128k Kontext
  • Intern-S1-Pro in Q2_K (~325 GB); Hunyuan-Large in Q4 (~220 GB)
  • MiniMax-Text-01 / M1 in Q4 (~260 GB)

Westliche Frontier-Modelle

  • Mistral Large 3 in Q2-Q3 (~243-317 GB) komfortabel (~20-30 tok/s einzeln, veröffentlichte Referenz)
  • Llama 4 Maverick in Q4_K_M (~232 GB) mit langem Kontext (~45-55 tok/s einzeln, veröffentlichte Referenz)
  • Llama-3.1-Nemotron Ultra 253B in fp8 (~253 GB)
  • Grok-1 314B in Q4 (~182 GB); Snowflake Arctic in Q4 (~278 GB)
  • DBRX Instruct 132B/36B in bf16 (~264 GB) oder fp8

Vision-Language-Modelle

Qwen3-VL-235B-A22B; InternVL3.5-241B-A28B Q4; GLM-4.5V / 4.6V 106B bf16; Llama 3.2 90B Vision bf16; Pixtral Large 124B fp8; Molmo 72B bf16.

Bildgenerierung

HunyuanImage-3.0 Instruct; FLUX.1 [dev] / [schnell] / Kontext als Multi-Instanz (~15-20 s pro Bild in 1024x1024, veröffentlichte Referenz); SD 3.5 Large; SDXL; AuraFlow; OmniGen; HunyuanImage-2.1; Kolors 2.0.

Videogenerierung

Wan 2.2 T2V-A14B Dual-Expert-MoE bf16; HunyuanVideo 13B bf16; Open-Sora 2.0 (11B); Mochi-1 (10B); NVIDIA Cosmos Predict 2 bis 14B; CogVideoX-5B; LTX-Video; Pyramid Flow.

Audio / Sprache / TTS

Kompletter Stack gleichzeitig im Speicher: Whisper v3 large, Parakeet-TDT 1.1B, Canary 1B, Moshi 7B in Echtzeit, Qwen3-Omni, Step-Audio R1, CosyVoice 3.0, Kokoro, Stable Audio Open.

Multi-Modell- / Multi-Tenant-Serving

  • DeepSeek V3 Q4 + FLUX + HunyuanVideo + Whisper/Moshi in Echtzeit — alles gleichzeitig im Speicher
  • Gleichzeitig 70B tensorparallel + 235B-MoE auf getrennten PCIe-Domänen
  • 3 Frontier-Modelle gleichzeitig im Speicher für A/B-Evaluierungen

Zielworkloads

  • Frontier-Forschungslabor mit Open-Weight-Modellen und gemischter bzw. nicht idealer Luftstrom-Infrastruktur
  • Colocation / privates Rechenzentrum, in dem ein Turbofan je Karte betrieblich einfacher ist als eine vollständig passive Luftführung
  • Souveräner KI-Betrieb mit einem Modell-Stack unter Apache 2.0 / MIT
  • Multi-Modell-RAG- und Agenten-Plattform im Unternehmen
  • Laborumgebungen mit offenen Racks

Veröffentlichte Leistungsreferenzen

Externe Referenzen | Gleiches Silizium wie Server Edition | Nicht auf Kentino-Hardware gemessen

Benchmark Ergebnis
RTX Pro 6000 INT8 TOPS je Karte 2 000 TOPS
vLLM — DeepSeek V3 Q4 auf 6x RTX Pro 6000 (einzeln) ~25-40 tok/s
vLLM — DeepSeek V3 Q4 auf 6x RTX Pro 6000 (Batch 32) 200-400 tok/s gesamt
FLUX.1 [dev] fp8 auf einer einzelnen RTX Pro 6000 ~15-20 s pro Bild in 1024x1024

Genaue Werte werden in der PoC-Phase bestätigt. Kentino veröffentlicht eigene Messwerte nach dem ersten Kundenaufbau.

Weniger geeignet für

  • Kimi-K2 / DeepSeek V3 in Q4 im Produktivbetrieb mit voller Geschwindigkeit — hier empfiehlt sich der Kentino AI 768 TurinDual RTXPro6000MQ
  • Training von Modellen der Frontier-Klasse von Grund auf — kein NVLink
  • Plug-and-play-Betrieb — das Serving von Frontier-MoE-Modellen erfordert ein erfahrenes MLOps-Team

Garantie und Lieferzeit

2 Jahre
Garantie auf Teile
1 Jahr
Garantie auf Arbeitsleistung
10-28 Tage
Lieferzeit

Der Aufbau umfasst Montage, BIOS-Konfiguration, Treiberinstallation, Burn-in, Memtest, Funktionsprüfung und die Einrichtung der LLM-Umgebung. Die Lieferzeit hängt von der Verfügbarkeit der Komponenten ab und wird bei Bestellung bestätigt.

Empfohlenes Zubehör

  • NVIDIA ConnectX-5 MCX555A-ECAT 100-GbE-NIC für Scale-out über mehrere Knoten
  • Zweite 4-TB-NVMe für Datensätze / Modellbibliothek
  • Komplettes 24U-Rack mit perforierter Fronttür
  • Online-USV 10 kVA
  • Managed PDU

Die Fragen, die uns Käufer vor der Bestellung eines Servers am häufigsten stellen.

Wie lange dauert es?

Maschinen aus Komponenten, die wir vorrätig haben, werden schnell versandt; alles, was eine bestimmte GPU-Generation erfordert, hängt von der Verfügbarkeit ab. Wir nennen Ihnen ein Datum, bevor Sie zahlen, und wenn es sich verschiebt, sagen wir es Ihnen, statt Sie es selbst herausfinden zu lassen.

Kann die Konfiguration vor dem Bau noch geändert werden?

Fast immer. GPUs, Arbeitsspeicher, Storage und Kühlung werden je Bestellung ausgewählt, und die angegebene Konfiguration ist ein Ausgangspunkt und kein festes Paket. Wenn Sie mehr VRAM, schnelleren Storage oder ein anderes Kühlkonzept benötigen, sagen Sie es vor der Bestellung – wir kalkulieren die Änderung.

Kann ich den Server persönlich abholen?

Das können Sie. Unser Lager befindet sich in Prag, und die persönliche Abholung ist willkommen – die meisten, die vorbeikommen, nutzen den Besuch, um die Maschine gemeinsam mit unserem Ingenieur durchzugehen und die Fragen zu stellen, die per E-Mail unangenehm sind. Bei Bestellungen innerhalb Tschechiens versuchen wir außerdem, persönlich zu liefern und Sie vor Ort durch die Einrichtung zu führen.

Kann ich mit jemandem sprechen, der den Workload wirklich versteht?

Ja. Bei uns arbeitet ein Ingenieur speziell an KI-Systemen, kein allgemeines Vertriebsteam. Wenn Ihre Frage Batch-Größen, Quantisierung, Interconnect oder die Frage betrifft, wo Ihr Engpass liegen wird, stellen Sie sie — dieses Gespräch verändert die Konfiguration meist zum Besseren.

Welches Modell kann ich auf dieser Konfiguration betreiben?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Wie testen Sie einen Server vor dem Versand?

Wir testen ihn mit echten KI-Workloads statt mit synthetischen Benchmarks: Inferenz-Durchsatz, Verhalten unter Dauerlast und Thermik im Dauerbetrieb. Die Benchmark-Ergebnisse erhalten Sie zusammen mit der Maschine, sodass Sie die zugesagte Leistung vom ersten Tag an selbst überprüfen können.

Ist der Server bei Lieferung betriebsbereit?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Versand aus unserem EU-Lager. Schwere Artikel erfordern unter Umständen eine Speditionslieferung — kontaktieren Sie uns für ein Versandangebot und die Lieferzeit. 2 Jahre eingeschränkte Garantie mit erweitertem RMA-Support; Garantieverlängerung verfügbar.

Nicht ganz das, was Sie brauchen?

Nennen Sie uns Ihren Workload, und wir legen diese Plattform darauf aus – GPUs, Arbeitsspeicher, Storage und Kühlung passend zu Ihrem tatsächlichen Betrieb.