Kentino KI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan
Kentino KI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan
Kentino KI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan
Kentino KI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan
Kentino KI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan
Kentino KI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan
Kentino KI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan
Kentino KI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan
Kentino KI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan
Kentino · Individueller KI-Server

Kentino KI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan

Plattform in Enterprise-Qualität, in der EU montiert und getestet.

€43.233,00 zzgl. MwSt. · Versand an der Kasse berechnet
Auf Lager — Versand aus dem EU-Lager
ISO 9001 · geprüfte HardwareEU-Lager & Garantie7+ Jahre in Enterprise-KIBurn-in-getestet vor dem Versand
Übersicht
FAQ
Versand & Garantie

Kentino AI 192 RomeDual 4090 5288TOPS

Inferenzserver mit 8 GPUs und 192 GB VRAM
8x RTX 4090 | Dual EPYC Milan | 5 288 TOPS INT8

5 288
INT8 TOPS
192 GB
VRAM-Pool
8-GPU
tensorparallel
dual
CPU 96C/192T

Flaggschiff-Inferenzsystem mit 8 Gaming-GPUs. 192 GB Pool zu den Kosten von Consumer-Karten auf einer Dual-Sockel-Plattform mit EPYC Milan.

Ein 7U-Chassis für 8 GPUs, aufgebaut um zwei EPYC 7643 Milan CPUs (insgesamt 96C/192T), ein ASRock Rack ROME2D32GM-NL Dual-SP3-Mainboard, 512 GB DDR4 ECC, 2 TB NVMe als Systemlaufwerk und ein Set aus 5x 1200 W Server-Netzteilen. Acht GeForce RTX 4090 sind über aktive PCIe-Gen4-Retimer-Riser mit vollen x16 angebunden. Der günstigste Weg zu Frontier-MoE-Inferenz mit 192 GB auf Kentino-Hardware.

Hardware

Komponente Details
GPUs 8x NVIDIA GeForce RTX 4090 24 GB GDDR6X (Ada Lovelace, 450 W, PCIe 4.0 x16)
VRAM-Pool 192 GB gesamt über 8 Karten (kein NVLink bei der Consumer-RTX 4090)
CPU 2x AMD EPYC 7643 Milan (je 48C/96T — insgesamt 96C/192T, je 225 W, 2x 128 PCIe-4.0-Lanes)
Mainboard ASRock Rack ROME2D32GM-NL (Dual SP3, PCIe 4.0, 32x DDR4-ECC-DIMM-Steckplätze)
Arbeitsspeicher 512 GB DDR4-2666 ECC RDIMM (8x 64 GB — 4 pro Sockel für ausgewogene 8-Kanal-Bestückung)
Systemlaufwerk / Speicher 2 TB NVMe M.2 (PCIe 4.0 x4)
Netzteil Set aus 5x 1200 W Server-Netzteilen (HP-kompatibel, Hot-Swap) + komplettes 12VHPWR-Adapterset
Gehäuse 7U-Chassis für 8 GPUs (bis zu 10 PCIe-Karten inklusive Riser)
Riser 8x aktive PCIe-Gen4-x16-Retimer-Riser (bei dieser Kabellänge erforderlich)
Kühlung 2x Arctic Freezer 4U-M SP3 Tower-Kühler + Rack-Luftstrom von vorn nach hinten (Industrielüfter)
Netzwerk Onboard Dual 10 GbE (Intel X550)

Leistungsbudget

  • GPU-Aufnahme: 8 x 450 W = 3 600 W
  • CPU-Aufnahme: 2 x 225 W = 450 W
  • System gesamt bei Volllast: ~4 200 W
  • Netzteilleistung gesamt: 6 000 W bei allen aktiv (5x 1200 W) — 30.0 % Reserve

Lane-Topologie

Das ROME2D32GM-NL stellt 2x 128 PCIe-Gen4-Lanes bereit — ein 128-Lane-Pool je EPYC-Sockel — direkt an den GPU-Steckplätzen. Aktive Gen4-Retimer-Riser für die Signalintegrität. Kein PCIe-Switch. Kein NVLink. Gemessen 19-22 GB/s Peer-to-Peer zwischen den GPUs auf dem 4-GPU-Prüfstand.

Was Sie darauf betreiben können

Mit 192 GB über 8 Karten bewältigt dieser Server Frontier-MoE-Modelle mit 200B+ in Q4, 8-fach tensorparallele Inferenz, mandantengetrenntes Multi-Modell-Serving und hohen Batch-Durchsatz zu den Kosten von Consumer-Karten.

LLMs — Text / Reasoning / Coding

Chinesische Spitzenmodelle

  • Qwen3 / Qwen3.5 (Alibaba): Qwen3-235B-A22B Q4 (~132 GB) mit langem ctx — die Paradekonfiguration (~15-25 tok/s Single-Stream auf 8x RTX 4090); Qwen3-Coder-480B-A35B Q2 (~160 GB); Qwen3.5-122B-A10B fp8 (~75 GB) im Multi-Stream; Qwen3-32B dense bf16 x mehrere parallel
  • DeepSeek: DeepSeek-V3/R1 Q2 (~215 GB mit Auslagerung in 512 GB Host-RAM); DeepSeek-R2 32B bf16 — bis zu 8 parallele Streams, einer pro Karte (~30-40 tok/s pro Stream)
  • GLM / Z.ai: GLM-4.5 / 4.6 / 4.7 Q4 (~177 GB); GLM-4.5-Air fp8 oder bf16; GLM-4.6V 106B
  • Tencent Hunyuan: Hunyuan-Large Q3 (~160 GB); Hunyuan-A13B Q4/Q6 (die RTX 4090 ist Ada — fp8 wird auf bf16 hochgerechnet, GGUF-Quants verwenden)
  • Weitere: Baidu ERNIE-4.5-424B Q3 (~180 GB); InternVL3.5-241B-A28B Q4 (~135 GB); Qwen3.5-397B Q3 (~170 GB); MiniMax-M1 Q3 (~180 GB)

Westliche Spitzenmodelle

  • Meta Llama: Llama 3.3 70B bf16 mit sehr großem KV-Cache (~20 tok/s Single-Stream Q4, ~179 tok/s batch-32 vLLM — von Kentino auf dem 4-GPU-Prüfstand gemessen); Llama 4 Scout bf16 (~218 GB, knapp); Llama 4 Maverick Q3 (~188 GB)
  • Mistral: Mistral Large 2 / Pixtral Large 123B Q6 mit Reserve oder bf16 (~248 GB mit Auslagerung); Mistral Small 3 im Multi-Stream
  • OpenAI (offene Gewichte): gpt-oss-120b MXFP4 nativ (80 GB) mit sehr großem KV-Cache
  • NVIDIA Nemotron: Llama-3.1-Nemotron Ultra 253B Q4 (~147 GB); Super 49B bf16
  • Weitere: Cohere Command R+ 104B Q6 (~85 GB); Google Gemma 3 27B bf16 x mehrere Streams

Vision-Language-Modelle

InternVL3.5-241B-A28B Q4 (~135 GB); Qwen3-VL-235B-A22B Q4; Qwen3-VL-32B bf16 im Multi-Stream; Llama 3.2 90B Vision bf16 (~180 GB); Pixtral Large 124B Q6; Molmo 72B bf16; GLM-4.6V 106B fp8/Q6; Gemma 3 27B multimodal x mehrere Streams.

Bildgenerierung

FLUX.1 [dev] bf16 — bis zu 8 parallele Generierungs-Streams (einer pro Karte, ~15-25 s/Bild bei fp8); FLUX.1 Kontext [dev]; FLUX Tools; SD 3.5 Large bf16 x 8; HunyuanImage-2.1 bf16 (~34 GB) x 2-4 parallel; HunyuanImage-3.0 Basismodell (80B MoE, 13B aktiv) bf16; HunyuanDiT; Kolors / Kolors 2.0; AuraFlow; OmniGen v1; PixArt-Sigma.

Videogenerierung

Wan 2.2 MoE Dual-Expert bf16 mit vollem ctx — mehrere parallele Streams; Wan 2.2 TI2V-5B x 8 parallel; HunyuanVideo 13B bf16 mit beiden Experten; HunyuanVideo 1.5; CogVideoX-5B bf16; Open-Sora 2.0 11B bf16; Genmo Mochi-1 bf16; LTX-Video x 8 parallel; Pyramid Flow; SVD / SV3D / SV4D; NVIDIA Cosmos.

Audio / Sprache / TTS

  • ASR: Whisper v3 large / turbo x 8 parallel (~50x Echtzeit pro Stream); Parakeet-TDT; Canary 1B; Qwen3-ASR; SenseVoice
  • TTS: CosyVoice 2/3; Kokoro 82M; XTTS v2; Stable Audio Open
  • Echtzeit / S2S: Kyutai Moshi 7B x 8 parallele Sprach-Streams; Step-Audio 2 mini/R1; Qwen2.5-Omni-7B
  • Musik / SFX: MusicGen / AudioGen / Bark; SeamlessM4T v2

Multi-Modell- und Multi-Mandanten-Serving

  • 8-fach tensorparallele Inferenz von 200-250B-MoE in Q4 (Qwen3-235B, GLM-4.5/4.6/4.7)
  • Mandantengetrenntes Serving mit 8 Streams — ein 24-GB-Q4-Modell pro Karte (z. B. 8x Qwen3-14B-Agenten)
  • 70B mit großen Batches — tensorparallel mit vLLM / SGLang, batch-64 aggregiert
  • Gemischter Betrieb: 235B MoE auf 4 Karten (TP4) + FLUX + Video + Echtzeit-Sprache auf den übrigen 4
  • Fine-Tuning-Labor — 7-34B LoRA / QLoRA mit großen Batches

Zielworkloads

  • Tensorparallele Inferenz über 8 GPUs im 192-GB-Pool — Qwen3-235B Q4, GLM-4.5/4.6/4.7 Q4, Llama 4 Scout bf16
  • Dense 70B bf16 (Llama 3.3 70B) mit großer KV-Reserve für langen ctx und große Batches
  • Batch-Inferenz-Gateway mit hohem Durchsatz — vLLM / SGLang tensorparallel bei großen Batches
  • Fine-Tuning von Modellen der 7-34B-Klasse mit LoRA / QLoRA bei großen Batches
  • Video- und Bildstudio mit komplettem Workflow: Wan 2.2 Dual-Expert / HunyuanImage-3.0 / FLUX.1

Gemessene Leistung

Kentino-Prüfstand (4-GPU-Referenz) | 2026-04-10 | 4x RTX 4090 + EPYC 7542 + 512 GB DDR4 + ROMED8-2T

Benchmark Ergebnis
Dauerhafte Rechenleistung (fp16, 4-Karten-Referenz) 647 TFLOPS
vLLM — Llama 3.3 70B AWQ INT4 (einzeln) 8.0 tok/s
vLLM — Llama 3.3 70B AWQ INT4 (batch-32) 179 tok/s aggregiert
llama.cpp — Llama 3.3 70B Q4_K_M (einzeln) 20.3 tok/s Decode
Aggregierte Rechenleistung über 8 GPUs (Hochrechnung) ~1 294 TFLOPS fp16 erwartet (nahezu linear)
235B Q4 tensorparallel 8-fach (Community) 15-25 tok/s Single-Stream auf 8x RTX 4090

Die 4-Karten-Werte wurden auf Kentino-Hardware gemessen. Die 8-GPU-Hochrechnung beruht auf veröffentlichten externen Referenzwerten. Kentino veröffentlicht eigene 8-GPU-Messwerte nach dem ersten Kundenaufbau.

Weniger geeignet für

  • Workloads der 5090-Generation (Blackwell mit nativem fp8 + höheren TOPS) — siehe Kentino AI 256 TurinDual 5090
  • Training von Grund auf (kein NVLink bei der Consumer-RTX 4090)
  • ECC-kritischen 24/7-Produktivbetrieb — die Consumer-RTX 4090 hat kein ECC; besser 4x L40 oder 2x RTX Pro 6000 Server Edition
  • Hunyuan / DeepSeek mit nativem fp8 — die RTX 4090 ist Ada, fp8-Checkpoints werden auf bf16 hochgerechnet

Garantie und Lieferzeit

2 Jahre
Garantie auf Teile
1 Jahr
Garantie auf Arbeit
10-28 Tage
Lieferzeit

Der Aufbau umfasst Montage, BIOS-Konfiguration mit NUMA-Tuning für zwei Sockel, Treiberinstallation, Burn-in, Memtest, vollständigen Stresstest aller 8 GPUs und die Einrichtung der LLM-Umgebung. Die Lieferzeit hängt von der Verfügbarkeit der Komponenten ab und wird bei Bestellung bestätigt.

Empfohlenes Zubehör

  • 4 TB zusätzliche NVMe für Weight-Staging und MoE-Offload-Workloads
  • NVIDIA ConnectX-5 100 GbE für Multi-Node-Serving
  • RAM-Aufrüstung auf 1 TB (16x 64 GB) oder 2 TB (32x 64 GB) — das Board unterstützt 32 DIMM-Steckplätze
  • Kompletter 24U-Rackschrank + Online-USV 5 kVA

Die Fragen, die uns Käufer vor der Bestellung eines Servers am häufigsten stellen.

Wie lange dauert es?

Maschinen aus Komponenten, die wir vorrätig haben, werden schnell versandt; alles, was eine bestimmte GPU-Generation erfordert, hängt von der Verfügbarkeit ab. Wir nennen Ihnen ein Datum, bevor Sie zahlen, und wenn es sich verschiebt, sagen wir es Ihnen, statt Sie es selbst herausfinden zu lassen.

Kann die Konfiguration vor dem Bau noch geändert werden?

Fast immer. GPUs, Arbeitsspeicher, Storage und Kühlung werden je Bestellung ausgewählt, und die angegebene Konfiguration ist ein Ausgangspunkt und kein festes Paket. Wenn Sie mehr VRAM, schnelleren Storage oder ein anderes Kühlkonzept benötigen, sagen Sie es vor der Bestellung – wir kalkulieren die Änderung.

Kann ich den Server persönlich abholen?

Das können Sie. Unser Lager befindet sich in Prag, und die persönliche Abholung ist willkommen – die meisten, die vorbeikommen, nutzen den Besuch, um die Maschine gemeinsam mit unserem Ingenieur durchzugehen und die Fragen zu stellen, die per E-Mail unangenehm sind. Bei Bestellungen innerhalb Tschechiens versuchen wir außerdem, persönlich zu liefern und Sie vor Ort durch die Einrichtung zu führen.

Kann ich mit jemandem sprechen, der den Workload wirklich versteht?

Ja. Bei uns arbeitet ein Ingenieur speziell an KI-Systemen, kein allgemeines Vertriebsteam. Wenn Ihre Frage Batch-Größen, Quantisierung, Interconnect oder die Frage betrifft, wo Ihr Engpass liegen wird, stellen Sie sie — dieses Gespräch verändert die Konfiguration meist zum Besseren.

Welches Modell kann ich auf dieser Konfiguration betreiben?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Wie testen Sie einen Server vor dem Versand?

Wir testen ihn mit echten KI-Workloads statt mit synthetischen Benchmarks: Inferenz-Durchsatz, Verhalten unter Dauerlast und Thermik im Dauerbetrieb. Die Benchmark-Ergebnisse erhalten Sie zusammen mit der Maschine, sodass Sie die zugesagte Leistung vom ersten Tag an selbst überprüfen können.

Ist der Server bei Lieferung betriebsbereit?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Versand aus unserem EU-Lager. Schwere Artikel erfordern unter Umständen eine Speditionslieferung — kontaktieren Sie uns für ein Versandangebot und die Lieferzeit. 2 Jahre eingeschränkte Garantie mit erweitertem RMA-Support; Garantieverlängerung verfügbar.

Nicht ganz das, was Sie brauchen?

Nennen Sie uns Ihren Workload, und wir legen diese Plattform darauf aus – GPUs, Arbeitsspeicher, Storage und Kühlung passend zu Ihrem tatsächlichen Betrieb.