Kentino KI 128 Rome 5090 6704TOPS — 4× RTX 5090 Blackwell KI-Server
Kentino KI 128 Rome 5090 6704TOPS — 4× RTX 5090 Blackwell KI-Server
Kentino KI 128 Rome 5090 6704TOPS — 4× RTX 5090 Blackwell KI-Server
Kentino KI 128 Rome 5090 6704TOPS — 4× RTX 5090 Blackwell KI-Server
Kentino KI 128 Rome 5090 6704TOPS — 4× RTX 5090 Blackwell KI-Server
Kentino KI 128 Rome 5090 6704TOPS — 4× RTX 5090 Blackwell KI-Server
Kentino KI 128 Rome 5090 6704TOPS — 4× RTX 5090 Blackwell KI-Server
Kentino KI 128 Rome 5090 6704TOPS — 4× RTX 5090 Blackwell KI-Server
Kentino KI 128 Rome 5090 6704TOPS — 4× RTX 5090 Blackwell KI-Server
Kentino · Individueller KI-Server

Kentino KI 128 Rome 5090 6704TOPS — 4× RTX 5090 Blackwell KI-Server

Plattform in Enterprise-Qualität, in der EU montiert und getestet.

€44.886,00 zzgl. MwSt. · Versand an der Kasse berechnet
Auf Lager — Versand aus dem EU-Lager
ISO 9001 · geprüfte HardwareEU-Lager & Garantie7+ Jahre in Enterprise-KIBurn-in-getestet vor dem Versand
Übersicht
FAQ
Versand & Garantie

Kentino AI 128 Rome 5090 6704TOPS

Blackwell-Inferenz-Server mit 128 GB VRAM
4x RTX 5090 | EPYC Milan | 6 704 TOPS INT8

6 704
INT8 TOPS
128 GB
VRAM-Pool
Blackwell
fp8 nativ
2.5x
vs. 4090 TOPS

Vier Blackwell-Karten RTX 5090 mit nativen fp8-/fp4-Tensor-Pfaden. Der durchsatzstärkste 4-GPU-Aufbau auf der Rome-Plattform.

Ein 4U-Rack-Inferenz-Server mit vier GeForce RTX 5090, gebündelt zu 128 GB VRAM, einer AMD EPYC 7643 Milan CPU (48C/96T), 512 GB DDR4 ECC (alle 8 DIMM-Steckplätze für maximale Bandbreite belegt), 2 TB NVMe-Systemlaufwerk und zwei synchronisierten 2-kW-ATX-Netzteilen. Führt vLLM, SGLang, llama.cpp und ComfyUI mit Blackwell-nativen fp8- und MXFP4-Inferenzkerneln aus.

Hardware

Komponente Details
GPUs 4x NVIDIA GeForce RTX 5090 32 GB GDDR7 (Blackwell, 575 W, PCIe 5.0 x16)
VRAM-Pool 128 GB gesamt über 4 Karten (kein NVLink bei der Consumer-5090)
CPU AMD EPYC 7643 Milan (48C/96T, 225 W, 128x PCIe 4.0 Lanes)
Mainboard ASRock Rack ROMED8-2T (SP3, 7x PCIe 4.0 x16, 8x DDR4 ECC, 2x 10 GbE, IPMI)
Arbeitsspeicher 512 GB DDR4-2666 ECC RDIMM (8x 64 GB — alle DIMM-Steckplätze belegt)
System- / Datenspeicher 2 TB NVMe M.2 (PCIe 4.0 x4)
Netzteil Zwei 2-kW-ATX-Netzteile mit Sync-Kabel + 12VHPWR-Adapterset
Gehäuse 4U-Rackgehäuse, 4x GPU, passive PCIe-4.0-x16-Riser
Kühlung Arctic Freezer 4U-M SP3 Tower + 3x 120 mm Lufteinlass vorne + 1x 120 mm Abluft hinten
Netzwerk Onboard Dual-10-GbE (Intel X550)

Leistungsbudget

  • GPU-Aufnahme: 4 x 575 W = 2 300 W
  • Systemgesamt unter Volllast: ~2 650 W
  • Netzteilleistung gesamt: 4 000 W (zwei 2 kW, synchronisiert) — 33.8 % Reserve
  • Zwei Netzteile für getrennte Stromversorgung — jedes Netzteil versorgt einen Teil des Systems

Lane-Topologie

Das ROMED8-2T führt 128 PCIe-Gen4-Lanes direkt von der EPYC auf sieben x16-Slots; vier davon sind mit GPUs im Gen4-x16-Betrieb belegt. Kein PCIe-Switch. Kein NVLink bei der Consumer-5090 — Peer-to-Peer zwischen den GPUs. Die Karten sind Gen5-nativ; Rome begrenzt auf Gen4.

Was Sie darauf betreiben können

Mit 128 GB gebündeltem VRAM und Blackwell-nativen fp8-Tensor-Pfaden erreicht dieser Server Qwen3-235B-A22B Q4 und gpt-oss-120b MXFP4 mit echter KV-Reserve — mehr, als 4x RTX 4090 leisten können.

LLMs — Text / Reasoning / Coding

Chinesische Spitzenmodelle

  • Qwen3 / Qwen3.5 (Alibaba): Qwen3-235B-A22B Q3-Q4 (~112-132 GB) passt mit 8-16k Kontext in den 128-GB-Pool — die Paradekonfiguration; Qwen3-32B dense bf16 (~65 GB) mit großzügigem KV-Cache; Qwen3-Coder-30B-A3B agentisch mit 1M Kontext; Qwen3.5-122B-A10B Q6/fp8 (~75-80 GB); QwQ-32B bf16 Reasoning
  • DeepSeek: DeepSeek-V3/R1/V3.1/V3.2 fp8-nativ Q2 (~215 GB) mit RAM-Auslagerung über 512 GB Hostspeicher — für Batch-Betrieb machbar; DeepSeek-R2 32B bf16 im Mehrfach-Stream (4 parallel, einer pro Karte)
  • GLM / Z.ai: GLM-4.5-Air 106B/12B fp8 (~106 GB) oder bequem in Q6; GLM-4.5/4.6/4.7 Q2_K_XL (~135 GB) knapp mit MoE-Offload
  • Tencent Hunyuan: Hunyuan-A13B nativ in fp8 (~80 GB) — Blackwell verarbeitet fp8 ohne Upcast-Aufschlag; Hunyuan-Large Q2 mit RAM-Auslagerung
  • ByteDance Seed-OSS-36B bf16 mit nativen 512k; ERNIE-4.5-424B Q2 (~150 GB mit Auslagerung)

Westliche Spitzenmodelle

  • Meta Llama: Llama 3.3 70B Q4 über 4x 5090 (~30-40 tok/s im Einzel-Stream, ~270+ tok/s Batch-32 mit vLLM); Llama 4 Scout 109B/17B MoE fp8/Q6 (~90 GB); Llama 4 Maverick 400B/17B Q3 (~188 GB mit Auslagerung)
  • Mistral: Mistral Small 3 / Magistral / Devstral Small 2 (24B) bf16 im Mehrfach-Stream; Pixtral Large / Mistral Large 2 (123B) Q6 (~88 GB)
  • OpenAI (offene Gewichte): gpt-oss-120b nativ in MXFP4 (80 GB) mit echtem KV-Cache und langem Kontext — der Paradeeinsatz für Blackwell; gpt-oss-20b MXFP4
  • Google Gemma 3: 27B multimodal bf16 (~54 GB) in zwei parallelen Streams; 12B / 4B
  • Microsoft Phi-4 14B dense bf16; Phi-4-reasoning destilliert
  • NVIDIA Nemotron: Llama-3.1-Nemotron Ultra 253B Q3 (~119 GB) knapp; Super 49B bf16 (~98 GB)
  • Weitere: Cohere Command R+ 104B Q6 (~85 GB); Molmo 72B Q6-bf16 VLM; OLMo 2 32B; IBM Granite 4.0 H-Small

Vision-Language-Modelle

Qwen3-VL-235B-A22B Q3-Q4; Qwen3-VL-32B bf16; InternVL3.5-241B-A28B Q4 (~135 GB, knapp); InternVL3 78B bf16; Llama 3.2 90B Vision Q6 (~74 GB); Pixtral Large 124B Q6 (~88 GB); Molmo 72B Q6/bf16; Gemma 3 27B multimodal bf16; GLM-4.6V 106B fp8.

Bildgenerierung

FLUX.1 [dev] bf16 und fp8 (~10-18 s pro Bild bei fp8); FLUX.1 Kontext [dev]; SD 3.5 Large bf16; HunyuanImage-2.1 bf16 und Q4; HunyuanImage-3.0 Base (80B MoE, 13B aktiv) bf16 (~80 GB, Parade-Footprint); HunyuanDiT; Kolors / Kolors 2.0; AuraFlow v0.3; OmniGen v1; PixArt-Sigma.

Videogenerierung

Wan 2.2 MoE mit zwei Experten bf16 (~54 GB, voller Kontext); Wan 2.2 TI2V-5B; HunyuanVideo 13B bf16 mit beiden Experten (~60-80 GB); HunyuanVideo 1.5; CogVideoX-5B bf16; Open-Sora 2.0 11B bf16 (~24 GB); Genmo Mochi-1 bf16 (~42 GB); LTX-Video; Pyramid Flow; SVD / SV3D / SV4D; NVIDIA Cosmos.

Audio / Sprache / TTS

  • ASR: Whisper v3 large / turbo (~50x Echtzeit); Parakeet-TDT; Canary 1B; Qwen3-ASR; SenseVoice
  • TTS: CosyVoice 2 / 3; Kokoro 82M; Stable Audio Open; XTTS v2; StyleTTS 2; Step-Audio-EditX
  • Echtzeit / S2S: Kyutai Moshi 7B; Step-Audio 2 mini/R1; Qwen2.5-Omni-7B
  • Musik / Soundeffekte: MusicGen / AudioGen / Bark; SeamlessM4T v2

Multi-Modell- / Multi-Tenant-Serving

  • 200B-MoE in Q4 mit Batch-Inferenz (Qwen3-235B, GLM-4.5/4.6/4.7-Air) für 8-16 gleichzeitige Nutzer
  • fp8-native Spitzenmodelle — DeepSeek-V3-Familie, Hunyuan-Large fp8 über die nativen Blackwell-Pfade
  • Gemischter resident geladener Stack: gpt-oss-120b MXFP4 + FLUX.1 + Whisper + Moshi bei partitioniertem VRAM
  • Hoher Durchsatz bei 70B — tensor-paralleles vLLM / SGLang mit über 200 tok/s aggregiert im Batch

Ziel-Workloads

  • Produktivbetrieb von MoE-Modellen ab 200B in Q3-Q4 mit echtem KV-Cache (Qwen3-235B, GLM-4.5-Air 106B)
  • fp8-native Inferenz mit Spitzenmodellen (DeepSeek V3/R1 fp8, Hunyuan fp8) — Blackwell arbeitet ohne Upcast
  • 70B-Serving mit hohem Durchsatz — tensor-paralleler Batch-Betrieb über vLLM oder SGLang
  • Videostudio mit bf16 (Wan 2.2 mit zwei Experten, HunyuanVideo 13B, Mochi-1)
  • Gemischter Multi-Tenant-Workload — 120B-MoE + Bildgenerierung + Echtzeit-Sprache gleichzeitig resident

Gemessene Leistung

Veröffentlichte Referenzen | NVIDIA RTX 5090 Datenblatt + Community-Benchmarks

Benchmark Ergebnis
INT8-TOPS pro Karte (NVIDIA-Datenblatt) 1 676 TOPS
Aggregierte INT8-TOPS (4 Karten) 6 704 TOPS
Speicherbandbreite pro Karte ~1 792 GB/s
Llama 3.3 70B Q6 über vLLM (Community) 60-90 tok/s im Einzel-Stream, 300+ tok/s im Batch
Qwen3-235B-A22B Q3-Q4 Passt mit 8-16k Kontext in den 128-GB-Pool
gpt-oss-120b nativ in MXFP4 80 GB — komfortabel mit KV-Reserve

Veröffentlichte externe Referenzen, nicht auf Kentino-Hardware gemessen. Kentino veröffentlicht eigene Messwerte nach dem ersten Kundenaufbau.

Weniger geeignet für

  • Spitzenmodelle ab 400B in Q4 (Kimi-K2, Mistral Large 3, Intern-S1-Pro — benötigen 8 GPUs oder 6x RTX Pro 6000)
  • Workloads, die auf PCIe-Gen5-Anbindung angewiesen sind — wählen Sie dafür die Genoa-Variante mit nativem Gen5 x16
  • Training von Grund auf (kein NVLink bei der Consumer-5090)
  • ECC-kritischen 24/7-Produktivbetrieb — die Consumer-5090 hat kein ECC; empfehlenswert sind L40 oder RTX Pro 6000 Server Edition

Garantie und Lieferzeit

2 Jahre
Garantie auf Teile
1 Jahr
Garantie auf Arbeitsleistung
10-28 Tage
Lieferzeit

Der Aufbau umfasst Montage, BIOS-Konfiguration, Treiberinstallation, Burn-in-Tests und Funktionsprüfung. Die Lieferzeit hängt von der Verfügbarkeit der Komponenten ab und wird bei Bestellung bestätigt.

Empfohlenes Zubehör

  • Netzteil-Upgrade auf zwei 2.5-kW-Modelle (FSP) für dauerhaften bf16- und Video-Volllastbetrieb — empfohlen für 24/7
  • 4 TB NVMe für die Modellbibliothek und die Bereitstellung von MoE-Gewichten
  • 24U-Open-Frame-Rack für Installationen mit mehreren Servern
  • Auf Anfrage die Variante auf Genoa-Plattform für eine Gen5-x16-Anbindung

Die Fragen, die uns Käufer vor der Bestellung eines Servers am häufigsten stellen.

Wie lange dauert es?

Maschinen aus Komponenten, die wir vorrätig haben, werden schnell versandt; alles, was eine bestimmte GPU-Generation erfordert, hängt von der Verfügbarkeit ab. Wir nennen Ihnen ein Datum, bevor Sie zahlen, und wenn es sich verschiebt, sagen wir es Ihnen, statt Sie es selbst herausfinden zu lassen.

Kann die Konfiguration vor dem Bau noch geändert werden?

Fast immer. GPUs, Arbeitsspeicher, Storage und Kühlung werden je Bestellung ausgewählt, und die angegebene Konfiguration ist ein Ausgangspunkt und kein festes Paket. Wenn Sie mehr VRAM, schnelleren Storage oder ein anderes Kühlkonzept benötigen, sagen Sie es vor der Bestellung – wir kalkulieren die Änderung.

Kann ich den Server persönlich abholen?

Das können Sie. Unser Lager befindet sich in Prag, und die persönliche Abholung ist willkommen – die meisten, die vorbeikommen, nutzen den Besuch, um die Maschine gemeinsam mit unserem Ingenieur durchzugehen und die Fragen zu stellen, die per E-Mail unangenehm sind. Bei Bestellungen innerhalb Tschechiens versuchen wir außerdem, persönlich zu liefern und Sie vor Ort durch die Einrichtung zu führen.

Kann ich mit jemandem sprechen, der den Workload wirklich versteht?

Ja. Bei uns arbeitet ein Ingenieur speziell an KI-Systemen, kein allgemeines Vertriebsteam. Wenn Ihre Frage Batch-Größen, Quantisierung, Interconnect oder die Frage betrifft, wo Ihr Engpass liegen wird, stellen Sie sie — dieses Gespräch verändert die Konfiguration meist zum Besseren.

Welches Modell kann ich auf dieser Konfiguration betreiben?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Wie testen Sie einen Server vor dem Versand?

Wir testen ihn mit echten KI-Workloads statt mit synthetischen Benchmarks: Inferenz-Durchsatz, Verhalten unter Dauerlast und Thermik im Dauerbetrieb. Die Benchmark-Ergebnisse erhalten Sie zusammen mit der Maschine, sodass Sie die zugesagte Leistung vom ersten Tag an selbst überprüfen können.

Ist der Server bei Lieferung betriebsbereit?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Versand aus unserem EU-Lager. Schwere Artikel erfordern unter Umständen eine Speditionslieferung — kontaktieren Sie uns für ein Versandangebot und die Lieferzeit. 2 Jahre eingeschränkte Garantie mit erweitertem RMA-Support; Garantieverlängerung verfügbar.

Nicht ganz das, was Sie brauchen?

Nennen Sie uns Ihren Workload, und wir legen diese Plattform darauf aus – GPUs, Arbeitsspeicher, Storage und Kühlung passend zu Ihrem tatsächlichen Betrieb.