Kentino KI 192 Rome L40 1448TOPS — 4× NVIDIA L40 — EPYC Milan
Plattform in Enterprise-Qualität, in der EU montiert und getestet.
Kentino AI 192 Rome L40 1448TOPS
192 GB ECC Enterprise-Inferenz-Server
4x NVIDIA L40 passiv | EPYC Milan | 1 448 TOPS INT8
Vier passive L40 Datacenter-Karten mit ECC-Speicher. Derselbe 192-GB-Pool wie bei 8x RTX 4090 — aber in Datacenter-Klasse, ECC-geschützt und mit OEM-Garantie.
Ein 4U-Inferenz-Server für das Rack mit vier passiven NVIDIA L40 Karten, die zu 192 GB ECC-VRAM gebündelt sind, einer AMD EPYC 7643 Milan CPU (48C/96T), 256 GB DDR4 ECC, 2 TB NVMe-Bootlaufwerk und zwei synchronisierten 2-kW-ATX-Netzteilen. Die L40 ist das Datacenter-Pendant zur RTX 4090 — passiv gekühlt, ECC-bestückt, mit NVENC/NVDEC-Hardware-Encodern auf dem Chip und 3 Jahren NVIDIA OEM-Garantie. Läuft ab Werk mit vLLM, SGLang, llama.cpp, Triton und TensorRT-LLM.
Hardware
| Komponente | Detail |
|---|---|
| GPUs | 4x NVIDIA L40 48 GB ECC GDDR6 (Ada Lovelace, passiv, 300 W, Dual-Slot, PCIe 4.0 x16) |
| VRAM-Pool | 192 GB ECC über 4 Karten (kein NVLink bei der L40) |
| CPU | AMD EPYC 7643 Milan (48C/96T, 225 W, 128x PCIe 4.0 Lanes) |
| Mainboard | ASRock Rack ROMED8-2T (SP3, 7x PCIe 4.0 x16, 8x DDR4 ECC, 2x 10 GbE, IPMI) |
| Arbeitsspeicher | 256 GB DDR4-2666 ECC RDIMM (4x 64 GB) |
| Boot / Speicher | 2 TB NVMe M.2 (PCIe 4.0 x4) |
| Netzteil | Zwei 2-kW-ATX-Netzteile mit Sync-Kabel |
| Gehäuse | 4U für das Rack mit gerichtetem Luftstrom von vorn nach hinten |
| Kühlung | Arctic Freezer 4U-M SP3 Tower + 3x 120 mm Einlass vorn + 1x 120 mm Auslass hinten |
| Netzwerk | Onboard 2x 10 GbE (Intel X550) |
Leistungsbudget
- GPU-Aufnahme: 4 x 300 W = 1 200 W
- Systemgesamtleistung unter Volllast: ~1 525 W
- Netzteilleistung gesamt: 4 000 W (zwei synchronisierte 2 kW) — 61.9 % Reserve
- Zwei Netzteile für aufgeteilte Stromversorgung und N+1-Fähigkeit
Lane-Topologie
PCIe Gen4 x16 pro Karte (die L40 ist nativ Gen4). Direkte Root-Complex-Anbindung an den einzelnen EPYC — kein PCIe-Switch. Kein NVLink — der Datenverkehr zwischen den GPUs läuft per PCIe Peer-to-Peer. Drei x16-Steckplätze bleiben für NIC- / Speichererweiterungen frei.
Was Sie damit betreiben können
Mit 192 GB ECC-VRAM über 4 Datacenter-Karten bewältigt dieser Server Frontier-MoE-Modelle mit über 200B Parametern in Q4, Enterprise-Multi-Tenant-Serving mit striktem SLA und 24/7 Produktivinferenz ohne ECC-bedingte Bit-Flip-Drift.
LLMs — Text / Reasoning / Coding
Chinesische Spitzenmodelle
- Qwen3 / Qwen3.5 (Alibaba): Qwen3-235B-A22B Q4 (~132 GB) mit langem Kontext — die Paradekonfiguration (~12-18 tok/s Single-Stream über 4x L40); Qwen3-Coder-480B-A35B Q2 (~160 GB, knapp); Qwen3.5-122B-A10B fp8 (~75 GB) mit riesigem KV; Qwen3-32B dense bf16 mit mehreren parallelen Streams
- DeepSeek: DeepSeek-V3/R1/V3.1/V3.2 Q2 (~215 GB mit geringem Auslagern in den Arbeitsspeicher); DeepSeek-R2 32B — 4x parallele Streams, einer je Karte
- GLM / Z.ai: GLM-4.5 / 4.6 / 4.7 Q4 (~177 GB) — der Idealfall für diese Klasse; GLM-4.5-Air 106B/12B fp8 oder bf16
- Tencent Hunyuan: Hunyuan-Large Q3 (~160 GB) — 389B MoE mit 256k ctx; Hunyuan-A13B fp8 (~80 GB) mit riesigem KV
- Baidu ERNIE-4.5-424B Q3 (~180 GB); InternVL3.5-241B-A28B Q4 (~135 GB); Qwen3.5-397B Q3 (~170 GB)
Westliche Spitzenmodelle
- Meta Llama: Llama 3.3 70B bf16 mit massivem KV (~15-18 tok/s Single-Stream auf 4x L40); Llama 4 Scout bf16 (~218 GB) knapp; Llama 4 Maverick 400B/17B Q3 (~188 GB)
- Mistral: Mistral Large 2 / Pixtral Large / Devstral 2 123B Q6 (~102 GB) komfortabel; Mistral Small 3 im Multi-Stream-Betrieb
- OpenAI (offene Gewichte): gpt-oss-120b MXFP4 (80 GB) mit großzügigem KV
- NVIDIA Nemotron: Llama-3.1-Nemotron Ultra 253B Q4 (~147 GB); Super 49B bf16 mit mehreren Streams
- Google Gemma 3: 27B multimodal bf16 — mehrere resident gehaltene Streams
- Weitere: Cohere Command R+ 104B Q6 (~85 GB); OLMo 3.1 32B; Reka Flash 3 21B; IBM Granite 4.0 H-Small
Vision-Language-Modelle
InternVL3.5-241B-A28B Q4 (~135 GB); Qwen3-VL-235B-A22B Q4; Qwen3-VL-32B bf16; Llama 3.2 90B Vision bf16 (~180 GB); Pixtral Large 124B Q6-bf16; Molmo 72B bf16; GLM-4.6V 106B fp8; Gemma 3 27B multimodal mit mehreren Streams; InternVL3 78B bf16; DeepSeek-VL2 in voller Bandbreite.
Bildgenerierung
FLUX.1 [dev] / [schnell] bf16 mit paralleler Generierung (~3-4 s je 1024x1024-Bild auf der L40); FLUX.1 Kontext [dev]; FLUX Tools; SD 3.5 Large bf16 x 2-3 parallel; HunyuanImage-2.1 bf16 (~34 GB) im Multi-Stream-Betrieb; HunyuanImage-3.0 Base (80B MoE, 13B aktiv) bf16 (~80 GB); HunyuanDiT; Kolors / Kolors 2.0; AuraFlow; OmniGen v1; PixArt-Sigma.
Videogenerierung
Wan 2.2 T2V-A14B / I2V-A14B MoE bf16 mit beiden Experten und vollem Kontext; Wan 2.2 TI2V-5B als schneller Pfad; HunyuanVideo 13B bf16 mit beiden Experten; HunyuanVideo 1.5; CogVideoX-5B bf16; Open-Sora 2.0 11B bf16; Mochi-1 bf16 (~42 GB) im Multi-Stream-Betrieb; LTX-Video; Pyramid Flow; SVD / SV3D / SV4D; NVIDIA Cosmos Predict 2.
Audio / Sprache / TTS
- ASR: Whisper v3 large / turbo (~50x Echtzeit); Parakeet-TDT; Canary 1B; Qwen3-ASR; SenseVoice
- TTS: CosyVoice 2/3; Kokoro 82M; XTTS v2; Stable Audio Open; Step-Audio-EditX
- Echtzeit / S2S: Kyutai Moshi 7B; Step-Audio 2 mini/R1; Qwen2.5-Omni-7B
- Musik / SFX: MusicGen / AudioGen / Bark; SeamlessM4T v2
Multi-Modell- / Multi-Tenant-Serving
- Produktives Enterprise-LLM-Gateway — Qwen3-235B Q4 oder GLM-4.5/4.6 Q4 bedienen 16-32 gleichzeitige Nutzer mit striktem SLA
- Gemischter resident gehaltener Stack: 235B MoE + FLUX.1 + Whisper-turbo + Moshi mit partitioniertem VRAM und ECC-Schutz
- Livevideo- und KI-Pipeline — die NVENC/NVDEC-Hardware-Encoder streamen 6-8 parallele Untertitelungs- und Moderations-Pipelines
- Multi-Tenant-RAG — Embedder auf der Abfrageseite + 70B-Reader + Reranker bei einer P99-Latenz unter einer Sekunde
Zielgerichtete Workloads
- 24/7 produktive LLM-Inferenz auf 192 GB Pool (Qwen3-235B Q4, GLM-4.5/4.6/4.7 Q4, Llama 4 Scout bf16)
- Enterprise-Multi-Tenant-Serving mit striktem SLA — ECC-Zuverlässigkeit über lange Laufzeiten
- RAG- und Vektordatenbank-Serving mit parallel laufenden hochwertigen Retrieval-Modellen
- Medien- und Video-KI-Pipelines — NVENC / NVDEC Hardwarepfad, VFX-Rendering, Transkription und Übersetzung
- Geräuscharmer Datacenter-Betrieb — passive Karten, niedriger Geräuschpegel in Büronähe
Gemessene Leistung
Veröffentlichte Referenzen | NVIDIA L40 Datenblatt + Community-Benchmarks
| Benchmark | Ergebnis |
|---|---|
| INT8 TOPS je Karte (NVIDIA Datenblatt) | 362 TOPS |
| INT8 TOPS gesamt (4 Karten) | 1 448 TOPS |
| VRAM je Karte | 48 GB ECC GDDR6, 864 GB/s Bandbreite |
| Llama 3.3 70B Q6 über vLLM (Community) | 30-50 tok/s Single-Stream, 150+ tok/s bei Batch-16 |
| FLUX.1 [dev] bf16 auf der L40 (Community) | ~3-4 s je 1024x1024-Bild |
| NVENC / NVDEC | Hardware-Encoder der 8. Generation auf dem Chip (Video-KI-Pipeline) |
Veröffentlichte externe Referenzwerte, nicht auf Kentino-Hardware gemessen. Kentino wird nach dem ersten Kundenaufbau eigene Messwerte veröffentlichen.
Weniger geeignet für
- Das Training großer Modelle von Grund auf (kein NVLink, begrenzte FP8-Tensor-Rechenleistung)
- Günstige Inferenz für einen einzelnen Nutzer (4x L4 oder 2x L40 sind deutlich preiswerter)
- Dense bf16 70B mit sehr langem Kontext auf einem einzigen Modell — hier sind 2x RTX Pro 6000 Server Edition die bessere Wahl (gleicher 192-GB-Pool, weniger TP-Overhead)
Garantie und Lieferzeit
3 Jahre NVIDIA OEM-Garantie auf die L40 plus Kentino-Integrationsgarantie. Der Aufbau umfasst Montage, BIOS-Konfiguration, Treiberinstallation, Burn-in-Test und Funktionsprüfung. Die Lieferzeit hängt von der Verfügbarkeit der Komponenten ab und wird bei Bestellung bestätigt.
Empfohlene Erweiterungen
- Aufrüstung des Arbeitsspeichers auf 512 GB (4x 64 GB DDR4 ergänzen — vier DIMM-Steckplätze sind noch frei)
- 4 TB NVMe für das Vorhalten der Modellbibliothek
- Komplettes 24U-Rack-Gehäuse mit managed PDU + Online-USV 5 kVA
Die Fragen, die uns Käufer vor der Bestellung eines Servers am häufigsten stellen.
Wie lange dauert es?
Maschinen aus Komponenten, die wir vorrätig haben, werden schnell versandt; alles, was eine bestimmte GPU-Generation erfordert, hängt von der Verfügbarkeit ab. Wir nennen Ihnen ein Datum, bevor Sie zahlen, und wenn es sich verschiebt, sagen wir es Ihnen, statt Sie es selbst herausfinden zu lassen.
Kann die Konfiguration vor dem Bau noch geändert werden?
Fast immer. GPUs, Arbeitsspeicher, Storage und Kühlung werden je Bestellung ausgewählt, und die angegebene Konfiguration ist ein Ausgangspunkt und kein festes Paket. Wenn Sie mehr VRAM, schnelleren Storage oder ein anderes Kühlkonzept benötigen, sagen Sie es vor der Bestellung – wir kalkulieren die Änderung.
Kann ich den Server persönlich abholen?
Das können Sie. Unser Lager befindet sich in Prag, und die persönliche Abholung ist willkommen – die meisten, die vorbeikommen, nutzen den Besuch, um die Maschine gemeinsam mit unserem Ingenieur durchzugehen und die Fragen zu stellen, die per E-Mail unangenehm sind. Bei Bestellungen innerhalb Tschechiens versuchen wir außerdem, persönlich zu liefern und Sie vor Ort durch die Einrichtung zu führen.
Kann ich mit jemandem sprechen, der den Workload wirklich versteht?
Ja. Bei uns arbeitet ein Ingenieur speziell an KI-Systemen, kein allgemeines Vertriebsteam. Wenn Ihre Frage Batch-Größen, Quantisierung, Interconnect oder die Frage betrifft, wo Ihr Engpass liegen wird, stellen Sie sie — dieses Gespräch verändert die Konfiguration meist zum Besseren.
Welches Modell kann ich auf dieser Konfiguration betreiben?
Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.
Wie testen Sie einen Server vor dem Versand?
Wir testen ihn mit echten KI-Workloads statt mit synthetischen Benchmarks: Inferenz-Durchsatz, Verhalten unter Dauerlast und Thermik im Dauerbetrieb. Die Benchmark-Ergebnisse erhalten Sie zusammen mit der Maschine, sodass Sie die zugesagte Leistung vom ersten Tag an selbst überprüfen können.
Ist der Server bei Lieferung betriebsbereit?
Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.
Versand aus unserem EU-Lager. Schwere Artikel erfordern unter Umständen eine Speditionslieferung — kontaktieren Sie uns für ein Versandangebot und die Lieferzeit. 2 Jahre eingeschränkte Garantie mit erweitertem RMA-Support; Garantieverlängerung verfügbar.
Nicht ganz das, was Sie brauchen?
Nennen Sie uns Ihren Workload, und wir legen diese Plattform darauf aus – GPUs, Arbeitsspeicher, Storage und Kühlung passend zu Ihrem tatsächlichen Betrieb.