Kentino KI 144 Rome L4 1452TOPS — 6× NVIDIA L4 — EPYC Milan
Kentino KI 144 Rome L4 1452TOPS — 6× NVIDIA L4 — EPYC Milan
Kentino KI 144 Rome L4 1452TOPS — 6× NVIDIA L4 — EPYC Milan
Kentino KI 144 Rome L4 1452TOPS — 6× NVIDIA L4 — EPYC Milan
Kentino · Individueller KI-Server

Kentino KI 144 Rome L4 1452TOPS — 6× NVIDIA L4 — EPYC Milan

Plattform in Enterprise-Qualität, in der EU montiert und getestet.

€42.029,00 zzgl. MwSt. · Versand an der Kasse berechnet
Auf Lager — Versand aus dem EU-Lager
ISO 9001 · geprüfte HardwareEU-Lager & Garantie7+ Jahre in Enterprise-KIBurn-in-getestet vor dem Versand
Übersicht
FAQ
Versand & Garantie

Kentino AI 144 Rome L4 1452TOPS

Leiser Edge-Inferenzserver mit 144 GB VRAM
6x NVIDIA L4 passiv | EPYC Milan | 1 452 TOPS INT8

1 452
INT8 TOPS
144 GB
VRAM-Pool
432 W
GPU-Leistungsbudget
leise
passive GPUs

Sechs passive L4-Rechenzentrumskarten. Der leiseste KI-Server im Kentino-Programm — auch für den Einsatz im Büroumfeld geeignet.

Ein 4U-Inferenzserver mit einem Sockel, sechs passiven NVIDIA L4 Karten (je 24 GB, 144 GB Pool), einer AMD EPYC 7643 Milan CPU (48C/96T), 384 GB DDR4 ECC, 2 TB NVMe Boot-Laufwerk und einem einzelnen 2-kW-ATX-Netzteil mit 62 % Reserve. Das Arbeitstier für dichte Edge-Inferenz: Embedding-Flotten, Multi-Tenant-Serving kleiner und mittlerer LLMs und Deployments in Bürolage, bei denen es auf Watt pro Anfrage ankommt.

Hardware

Komponente Detail
GPUs 6x NVIDIA L4 24 GB (Ada Lovelace, passiv, 72 W, Single-Slot LP, PCIe Gen4 x8)
VRAM-Pool 144 GB gesamt über 6 Karten
CPU AMD EPYC 7643 Milan (48C/96T, 225 W, 128 PCIe 4.0 Lanes)
Mainboard ASRock Rack ROMED8-2T (SP3, 7x PCIe 4.0 x16, 8x DDR4 ECC, 2x 10 GbE, IPMI)
Systemspeicher 384 GB DDR4-2666 ECC RDIMM (6x 64 GB)
Boot / Speicher 2 TB NVMe M.2 (PCIe 4.0 x4)
Netzteil 1x 2 kW ATX-Netzteil
Gehäuse 4U Rack-Montage (Layout für 6 Karten)
Kühlung SP3 Tower-Kühler + gerichteter Luftstrom von vorne nach hinten (Industrielüfter)
Netzwerk Onboard Dual 10 GbE (Intel X550)

Leistungsbudget

  • GPU-Aufnahme: 6 x 72 W = 432 W
  • Systemgesamtwert unter Volllast: ~757 W
  • Netzteilleistung gesamt: 2 000 W — 62 % Reserve
  • Leiser Betrieb, enorme thermische Reserve

Lane-Topologie

Die L4 ist nativ PCIe Gen4 x8 — kein Bandbreitenverlust gegenüber dem Host. Das ROMED8-2T bietet 7x x16 Slots; ein Slot bleibt für eine optionale NIC frei. Kein PCIe-Switch erforderlich. Kein NVLink.

Was Sie betreiben können

Mit 144 GB über 6 physische Karten liegt der Sweet Spot beim parallelen Multi-Modell-Serving: Betreiben Sie ein 70B-Dense-Modell in Q4, ein 30B-MoE, einen 14B-Coder, ein VLM und ein Embedding-Modell gleichzeitig — und behalten Sie dabei noch Reserve für den KV-Cache.

LLMs — Text / Reasoning / Coding

Chinesische Spitzenmodelle

  • Qwen3 / Qwen3.5 (Alibaba): Qwen3-30B-A3B Q4-Q6; QwQ-32B Q6; Qwen3-32B dense Q6; Qwen3.5-122B-A10B Q4-Q5 (~75 GB, komfortabel); Qwen3-235B-A22B Q3 (~112 GB) knapp, nur kurzer Kontext
  • DeepSeek: DeepSeek-R2 32B sparse MoE Q4-Q6 (auf einer einzelnen Karte lauffähig, 6x parallele Streams, ~15-20 tok/s je Stream); Seed-OSS-36B Q4-Q6 mit 512k nativem Kontext
  • GLM / Z.ai: GLM-4.5-Air Q4-Q5 (60-70 GB, komfortabel); Hunyuan-A13B Q4-Q6 (~48 GB)
  • Baidu ERNIE-4.5-47B-A3B Q4; Step-3.5-Flash Q3-Q4 mit etwas Auslagerung in den RAM

Westliche Spitzenmodelle

  • Meta Llama: Llama 3.3 70B Q4-Q6 (43-58 GB) mit großzügigem KV-Cache (~10-17 tok/s Single-Stream über 6x L4 tensorparallel); Llama 4 Scout 109B/17B MoE Q4 (~63 GB), komfortabel
  • Mistral: Mistral Small 3 / Magistral Small 1.2 / Devstral Small 2 (24B) in bf16 (~50-65 tok/s je L4 Karte); Mixtral 8x22B Q4
  • OpenAI (offene Gewichte): gpt-oss-120b nativ in MXFP4 (~80 GB) mit Reserve; gpt-oss-20b MXFP4
  • Google Gemma 3: 27B bf16; Phi-4 14B bf16
  • NVIDIA Nemotron: Llama-3.1-Nemotron Super 49B Q4-Q6; Pixtral 12B / Pixtral Large Q4 (~72 GB)

Vision-Language-Modelle

Qwen3-VL-8B/32B, Qwen3-VL-30B-A3B MoE, InternVL3 bis 78B Q4 (~48 GB), InternVL3.5-38B, DeepSeek-VL2, Llama 3.2 11B Vision bf16, Llama 3.2 90B Vision Q4 (~52 GB), Molmo 72B Q4, Gemma 3 12B/27B multimodal, MiniCPM-V 2.6 / MiniCPM-o 2.6, GLM-4.6V-Flash.

Bildgenerierung

FLUX.1 [dev] / [schnell] fp8 (~20-35 s/Bild auf einer einzelnen L4 in fp8); FLUX.1 Kontext [dev]; FLUX Tools; SD 3.5 Large (18 GB fp16 / 11 GB fp8); SDXL 1.0; HunyuanImage-2.1 (~34 GB bf16); HunyuanDiT; Kolors 2.0; AuraFlow v0.3; OmniGen v1; PixArt-Sigma.

Videogenerierung

Wan 2.2 T2V-A14B / I2V-A14B MoE (knapp in bf16, ~54 GB); Wan 2.2 TI2V-5B als schneller Pfad; HunyuanVideo 13B Q4-Q8 (~30 GB); HunyuanVideo 1.5 (8.3B); CogVideoX-5B; Open-Sora 2.0 Q8 (~16 GB); Mochi-1 Q4 (~18 GB); LTX-Video; Pyramid Flow; SVD / SV3D / SV4D; NVIDIA Cosmos.

Audio / Sprache / TTS

  • ASR: Whisper v3 large / turbo (~50x Echtzeit); Parakeet-TDT; Canary 1B; Qwen3-ASR; SenseVoice
  • TTS: CosyVoice 2 / 3; Kokoro 82M; Stable Audio Open; XTTS v2; StyleTTS 2; Step-Audio-EditX
  • Echtzeit / S2S: Kyutai Moshi 7B; Step-Audio 2 mini/R1; Qwen2.5-Omni-7B
  • Musik / SFX: MusicGen / AudioGen / Bark; SeamlessM4T v2

Multi-Modell- / Multi-Tenant-Serving

  • 6 parallele Streams eines 24-GB-Modells in Q4 (eines je Karte): z. B. 6x Qwen3-14B Q4 Agenten
  • Gemischter Betrieb: Llama 3.3 70B Q4 (tensorparallel über 2 Karten) + FLUX.1 (1 Karte) + Whisper-turbo (1 Karte) + Moshi (1 Karte) + BGE-M3 Embedder (1 Karte)
  • Embedding-Dienst mit hoher QPS — 6x parallele Embedding-Streams von BGE-M3 / E5 / Nomic / Cohere Embed
  • Video-Transcoding-Farm — 6x parallele NVENC/NVDEC-Streams

Zielworkloads

  • SaaS Multi-Tenant LLM-API — 20-40 gleichzeitige Nutzer auf einem 24B/32B-Modell bedienen, mit Platz für Bild und ASR nebenher
  • RAG-Backend — Embedder auf der Query-Seite + 70B Q4 Reader + Reranker, Latenz unter einer Sekunde, 50 QPS
  • Video-KI-Pipeline — Live-Transcoding + Untertitelung + Moderation auf 6 parallelen Streams
  • Edge-KI-Appliance in Büronähe — geringe Geräuschentwicklung, keinerlei Rechenzentrumsabhängigkeit
  • Entwicklungsplattform für Modelle der Mittelklasse — schnelle Iteration bei 30-70B Fine-Tunes, eine Karte je Experiment

Gemessene Leistung

Veröffentlichte Referenzwerte | NVIDIA L4 Datenblatt + Community-Benchmarks

Benchmark Ergebnis
INT8 TOPS je Karte (NVIDIA Datenblatt) 242 TOPS
INT8 TOPS gesamt (6 Karten) 1 452 TOPS
Llama 3.1 8B Q4 auf einer einzelnen L4 (Community) ~35-45 tok/s Single-Stream
BGE-M3 Embedding-QPS auf der L4 (Community) ~800 QPS bei 512 Token Eingabe
Whisper v3 turbo Echtzeitfaktor ~1.5-2x Echtzeit je Karte

Veröffentlichte externe Referenzwerte, nicht auf Kentino Hardware gemessen. Kentino wird nach dem ersten Kundenaufbau eigene Messwerte veröffentlichen.

Weniger geeignet für

  • Spitzenmodelle mit 200B+ MoE in Q4 und höher mit langem Kontext — hier passen 4x L40 oder 8x RTX 4090 (192 GB Pool, zusammenhängendes TP) besser
  • Trainings-Workloads — der L4 fehlen FP8 und die Bandbreite für effizientes Training
  • Maximaler Durchsatz für eine einzelne Aufgabe — die Rechenleistung je Karte ist gegenüber L40 / RTX Pro 6000 bescheiden

Garantie und Lieferzeit

2 Jahre
Garantie auf Teile
1 Jahr
Garantie auf Arbeitsleistung
10-28 Tage
Lieferzeit

3 Jahre NVIDIA OEM-Garantie auf die L4 + Kentino Integrationsgarantie. Der Aufbau umfasst Montage, BIOS-Konfiguration, Treiberinstallation, Burn-in-Test und Funktionsprüfung. Die Lieferzeit hängt von der Verfügbarkeit der Komponenten ab und wird bei Bestellung bestätigt.

Empfohlenes Zubehör

  • Upgrade auf 4 TB NVMe für das Bereitstellen der Modellbibliothek
  • 24U offener Rack-Schrank mit verwalteter PDU

Die Fragen, die uns Käufer vor der Bestellung eines Servers am häufigsten stellen.

Wie lange dauert es?

Maschinen aus Komponenten, die wir vorrätig haben, werden schnell versandt; alles, was eine bestimmte GPU-Generation erfordert, hängt von der Verfügbarkeit ab. Wir nennen Ihnen ein Datum, bevor Sie zahlen, und wenn es sich verschiebt, sagen wir es Ihnen, statt Sie es selbst herausfinden zu lassen.

Kann die Konfiguration vor dem Bau noch geändert werden?

Fast immer. GPUs, Arbeitsspeicher, Storage und Kühlung werden je Bestellung ausgewählt, und die angegebene Konfiguration ist ein Ausgangspunkt und kein festes Paket. Wenn Sie mehr VRAM, schnelleren Storage oder ein anderes Kühlkonzept benötigen, sagen Sie es vor der Bestellung – wir kalkulieren die Änderung.

Kann ich den Server persönlich abholen?

Das können Sie. Unser Lager befindet sich in Prag, und die persönliche Abholung ist willkommen – die meisten, die vorbeikommen, nutzen den Besuch, um die Maschine gemeinsam mit unserem Ingenieur durchzugehen und die Fragen zu stellen, die per E-Mail unangenehm sind. Bei Bestellungen innerhalb Tschechiens versuchen wir außerdem, persönlich zu liefern und Sie vor Ort durch die Einrichtung zu führen.

Kann ich mit jemandem sprechen, der den Workload wirklich versteht?

Ja. Bei uns arbeitet ein Ingenieur speziell an KI-Systemen, kein allgemeines Vertriebsteam. Wenn Ihre Frage Batch-Größen, Quantisierung, Interconnect oder die Frage betrifft, wo Ihr Engpass liegen wird, stellen Sie sie — dieses Gespräch verändert die Konfiguration meist zum Besseren.

Welches Modell kann ich auf dieser Konfiguration betreiben?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Wie testen Sie einen Server vor dem Versand?

Wir testen ihn mit echten KI-Workloads statt mit synthetischen Benchmarks: Inferenz-Durchsatz, Verhalten unter Dauerlast und Thermik im Dauerbetrieb. Die Benchmark-Ergebnisse erhalten Sie zusammen mit der Maschine, sodass Sie die zugesagte Leistung vom ersten Tag an selbst überprüfen können.

Ist der Server bei Lieferung betriebsbereit?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Versand aus unserem EU-Lager. Schwere Artikel erfordern unter Umständen eine Speditionslieferung — kontaktieren Sie uns für ein Versandangebot und die Lieferzeit. 2 Jahre eingeschränkte Garantie mit erweitertem RMA-Support; Garantieverlängerung verfügbar.

Nicht ganz das, was Sie brauchen?

Nennen Sie uns Ihren Workload, und wir legen diese Plattform darauf aus – GPUs, Arbeitsspeicher, Storage und Kühlung passend zu Ihrem tatsächlichen Betrieb.