Kentino KI 192 Rome ArcProB70 TBD — 6× Intel Arc Pro B70 — EPYC Milan (Vorbestellung)
Plattform in Enterprise-Qualität, in der EU montiert und getestet.
IN VORBEREITUNG
Vorbestellung — Intel Arc Pro B70, geplante Auslieferung Q3 2026
Kentino AI 192 Rome ArcProB70 TBD
192 GB VRAM Intel Xe2 Inferenz-Server
6x Arc Pro B70 | EPYC Milan | TOPS TBD
Preisbewusster Build mit viel VRAM, ausgelegt auf den quelloffenen Inferenz-Stack von Intel. Preisbindung ab Verfügbarkeit bei Intel.
Ein 4U-Rack-Inferenz-Server mit sechs Intel Arc Pro B70 Creator Karten (je 32 GB Xe2-HPG "Battlemage", 192 GB gesamt), einer AMD EPYC 7643 Milan CPU (48C/96T), 384 GB DDR4 ECC, 2 TB NVMe-Bootlaufwerk und einem 2-kW-ATX-Netzteil (Upgrade auf zwei Netzteile dringend empfohlen). Gebaut für das Intel-Software-Ökosystem: OpenVINO 2025+, IPEX-LLM, llama.cpp SYCL-Backend und vLLM-Intel-Forks. Reine CUDA-Workloads laufen auf dieser Hardware nicht.
Hardware
| Komponente | Detail |
|---|---|
| GPUs | 6x Intel Arc Pro B70 Creator 32 GB (Xe2-HPG "Battlemage", 250 W, PCIe 5.0 x16, Dual-Slot) |
| VRAM-Pool | 192 GB gesamt über 6 Karten (kein Fabric zwischen den Karten — Peer-Traffic über PCIe) |
| CPU | AMD EPYC 7643 Milan (48C/96T, 225 W, 128x PCIe 4.0 Lanes) |
| Mainboard | ASRock Rack ROMED8-2T (SP3, 7x PCIe 4.0 x16, 8x DDR4 ECC, 2x 10 GbE, IPMI) |
| System-RAM | 384 GB DDR4-2666 ECC RDIMM (6x 64 GB) |
| Boot / Speicher | 2 TB NVMe M.2 (PCIe 4.0 x4) |
| Netzteil | 1x 2-kW-ATX-Netzteil (Upgrade auf zwei synchronisierte 2-kW-Netzteile dringend empfohlen) |
| Gehäuse | 4U-Rack-Einbau (6-Slot-Layout) |
| Kühlung | SP3-Tower-Kühler (Arctic Freezer 4U-M) + gerichteter Luftstrom von vorn nach hinten (Industrielüfter) |
| Netzwerk | Onboard Dual 10 GbE (Intel X550) |
Leistungsbudget
- GPU-Aufnahme: 6 x 250 W = 1 500 W (von Intel angegebene TDP)
- Systemleistung gesamt unter Volllast: ~1 825 W
- Netzteil gesamt: 2 000 W (einzeln) — nur 8.75 % Reserve
- Zwei synchronisierte 2-kW-Netzteile dringend empfohlen — stellt ~45 % Reserve her
Lane-Topologie
Das ROMED8-2T bietet 7x PCIe 4.0 x16 Lanes. Sechs Slots sind belegt, einer bleibt für eine NIC frei. Die Arc Pro B70 ist nativ PCIe Gen5, das ROMED8-2T läuft mit Gen4 — die Bandbreiteneinbuße ist bei Inferenz mit 32 GB pro Karte vernachlässigbar. Kein PCIe-Switch. Kein Äquivalent zu Xe-Link.
Was Sie darauf betreiben können
Alle Kompatibilitätsangaben beziehen sich auf Pfade im Intel-Software-Stack (OpenVINO, IPEX-LLM, llama.cpp SYCL, vLLM-Intel). Reine CUDA-Workloads laufen auf dieser Hardware nicht. Alle Angaben stammen aus veröffentlichten externen Quellen und werden nach Auslieferung der Karten unabhängig überprüft.
LLMs — Text / Reasoning / Coding
Chinesische Spitzenmodelle
- Qwen3 / Qwen3.5 (Alibaba): Qwen3-235B-A22B Q4 (~132 GB) mit Spielraum für langen Kontext; Qwen3-Coder-480B-A35B Q2 (~160 GB); Qwen3.5-397B-A17B Q3 (~170 GB)
- GLM / Z.ai: GLM-4.5 / 4.6 / 4.7 Q4 (~177 GB) — passt mit moderatem KV
- Tencent Hunyuan: Hunyuan-Large Q3 (~160 GB); Hunyuan-A13B fp8 (~80 GB), sofern der Xe2-fp8-Pfad im Treiber freigeschaltet ist
- Weitere: Baidu ERNIE-4.5-424B Q3 (~180 GB); MiniMax-M1 Q3 (~180 GB); DeepSeek-R2 32B (6x parallele Streams)
Westliche Spitzenmodelle
- Meta Llama: Llama 3.3 70B Q6-Q8 mit großzügigem KV; Llama 4 Scout 109B/17B Q4 (~63 GB) mit reichlich Reserve
- Mistral: Mistral Small 3 / Magistral Small / Devstral Small 2 (24B) in bf16; Pixtral Large Q4-Q6
- OpenAI (offene Gewichte): gpt-oss-120b nativ MXFP4 (~80 GB) — sofern MXFP4-Dequantisierung im Intel-Stack verfügbar ist
- NVIDIA Nemotron: Llama-3.1-Nemotron Ultra 253B Q4 (~120 GB)
- Weitere: Gemma 3 27B bf16 multimodal; Phi-4 / Phi-4-reasoning 14B; Cohere Command R+ 104B Q4
Vision-Language-Modelle
Qwen3-VL-8B / 32B; Qwen3-VL-30B-A3B MoE; InternVL3 bis 78B; InternVL3.5-38B; Llama 3.2 90B Vision Q4; Pixtral 12B; Molmo 72B Q4; Gemma 3 12B/27B multimodal; MiniCPM-V 2.6 / MiniCPM-o 2.6. Das OpenVINO von Intel unterstützt Vision-Tower sehr gut — VLM dürfte hier von Tag eins an eine Stärke sein.
Bildgenerierung
FLUX.1 [dev] / [schnell] fp8 oder Q4 GGUF über llama.cpp SYCL; SDXL / SD 3.5 Large über die OpenVINO-genAI-Runtime; HunyuanDiT; HunyuanImage-2.1 bf16 (~34 GB); Kolors 2.0; AuraFlow; OmniGen; PixArt-Sigma.
Videogenerierung
Wan 2.2 T2V-A14B / I2V-A14B MoE (~54 GB bf16); Wan 2.2 TI2V-5B; HunyuanVideo 13B bf16; HunyuanVideo 1.5; CogVideoX-5B; Open-Sora 2.0; LTX-Video; Pyramid Flow; Mochi-1 Q4. Video ist derzeit der schwächste Intel-Pfad — zum Auslieferungszeitpunkt ist mit funktionierender, aber nicht durchsatzoptimierter Ausführung zu rechnen.
Audio / Sprache / TTS
- ASR: Whisper v3 large / turbo über OpenVINO (erstklassige Whisper-Unterstützung bei Intel); Parakeet-TDT; Canary; SenseVoice
- TTS: CosyVoice 2/3; Kokoro 82M; Stable Audio Open; XTTS v2; StyleTTS 2; Step-Audio-EditX
- Echtzeit / S2S: Kyutai Moshi; MusicGen / AudioGen / Bark; SeamlessM4T v2
Multi-Modell- / Multi-Tenant-Serving
- 6 parallele Streams eines 32-GB-Q4-Modells (einer pro Karte) — z. B. 6x Qwen3-32B-Q4-Agenten
- Embedding-Flotte im großen Maßstab — 6x parallele BGE-M3- / E5- / Nomic-Embed-Streams (OpenVINO-optimiert)
- Gemischte Belegung — 70B Q4 (tensor-parallel über 3 Karten) + FLUX.1 (1 Karte) + Whisper-turbo (1 Karte) + Moshi (1 Karte)
Zielanwendungen
- Evaluierungspilot für Intel-Software als CUDA-Alternative beim LLM-Serving
- Embedding- / Reranker-Backend, bei dem VRAM pro Euro wichtiger ist als reiner Durchsatz
- Preisbewusste Q4-Inferenz von Frontier-MoE-Modellen (Qwen3-235B, GLM-4.5/4.6/4.7) für kleine interne Entwicklerteams
- OpenVINO-native Modellbereitstellung neben bestehenden Intel-Xeon- / Arc-Pro-Pipelines
- Backend für VLM, OCR und Dokumentenverarbeitung (eine Stärke von Intels OpenVINO)
Gemessene Leistung
Von Intel veröffentlichte Spezifikationen | Unabhängige Überprüfung nach Auslieferung der Karten
| Spezifikation | Wert |
|---|---|
| VRAM pro Karte | 32 GB GDDR6 |
| Speicherbandbreiten-Klasse | ~450 GB/s pro Karte |
| Xe Matrix Extensions (XMX) | Beschleunigt über OpenVINO / IPEX-LLM |
| fp8-Pfad | Xe2-Silizium — Freigabe im Treiber zum Auslieferungszeitpunkt prüfen |
Keine von Kentino gemessenen Daten. Die von Intel veröffentlichten Spezifikationen werden unabhängig überprüft. Kentino veröffentlicht eigene Werte zu tok/s, QPS und Bandbreite, sobald die erste Einheit den Burn-in bestanden hat.
Weniger geeignet für
- CUDA-native Workloads — auf Intel gibt es kein CUDA, mit Migrationsaufwand ist zu rechnen
- SLA-kritischen Produktivbetrieb, solange Verfügbarkeit und Tooling der Intel Arc Pro noch nicht stabil sind
- Frontier-MoE-Modelle ab 600B bei Q4+ (erfordert 6x RTX Pro 6000 / 576 GB Pool)
- Trainings-Workloads — die Arc Pro ist auf Inferenz ausgelegt, die Framework-Reife für verteiltes Training ist begrenzt
- Kunden, die vor dem Kauf gemessene Benchmarks benötigen — diese SKU ist eine Vorbestellung
Garantie und Lieferzeit
Kentino Standardgarantie (2 Jahre auf Teile, 1 Jahr auf Arbeitsleistung); strengere Bedingungen des Intel-Vertriebs gehen vor. Der Aufbau umfasst Montage, BIOS-Konfiguration, Treiberinstallation, Burn-in-Test und Funktionsprüfung. Sichern Sie sich Ihren Liefertermin aus der ersten Welle über das Kentino-Kontaktformular. 30 Tage Preisbindung ab Bestellung.
Empfohlene Erweiterungen
- Upgrade auf zwei synchronisierte 2-kW-Netzteile (bei 1 825 W Aufnahme ist die Reserve eines einzelnen Netzteils knapp — dringend empfohlen)
- RAM-Upgrade auf 512 GB DDR4 (2x 64 GB — zwei Slots frei)
- 4 TB NVMe als zweites Laufwerk für die Modellbibliothek
Die Fragen, die uns Käufer vor der Bestellung eines Servers am häufigsten stellen.
Wie lange dauert es?
Maschinen aus Komponenten, die wir vorrätig haben, werden schnell versandt; alles, was eine bestimmte GPU-Generation erfordert, hängt von der Verfügbarkeit ab. Wir nennen Ihnen ein Datum, bevor Sie zahlen, und wenn es sich verschiebt, sagen wir es Ihnen, statt Sie es selbst herausfinden zu lassen.
Kann die Konfiguration vor dem Bau noch geändert werden?
Fast immer. GPUs, Arbeitsspeicher, Storage und Kühlung werden je Bestellung ausgewählt, und die angegebene Konfiguration ist ein Ausgangspunkt und kein festes Paket. Wenn Sie mehr VRAM, schnelleren Storage oder ein anderes Kühlkonzept benötigen, sagen Sie es vor der Bestellung – wir kalkulieren die Änderung.
Kann ich den Server persönlich abholen?
Das können Sie. Unser Lager befindet sich in Prag, und die persönliche Abholung ist willkommen – die meisten, die vorbeikommen, nutzen den Besuch, um die Maschine gemeinsam mit unserem Ingenieur durchzugehen und die Fragen zu stellen, die per E-Mail unangenehm sind. Bei Bestellungen innerhalb Tschechiens versuchen wir außerdem, persönlich zu liefern und Sie vor Ort durch die Einrichtung zu führen.
Kann ich mit jemandem sprechen, der den Workload wirklich versteht?
Ja. Bei uns arbeitet ein Ingenieur speziell an KI-Systemen, kein allgemeines Vertriebsteam. Wenn Ihre Frage Batch-Größen, Quantisierung, Interconnect oder die Frage betrifft, wo Ihr Engpass liegen wird, stellen Sie sie — dieses Gespräch verändert die Konfiguration meist zum Besseren.
Welches Modell kann ich auf dieser Konfiguration betreiben?
Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.
Wie testen Sie einen Server vor dem Versand?
Wir testen ihn mit echten KI-Workloads statt mit synthetischen Benchmarks: Inferenz-Durchsatz, Verhalten unter Dauerlast und Thermik im Dauerbetrieb. Die Benchmark-Ergebnisse erhalten Sie zusammen mit der Maschine, sodass Sie die zugesagte Leistung vom ersten Tag an selbst überprüfen können.
Ist der Server bei Lieferung betriebsbereit?
Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.
Versand aus unserem EU-Lager. Schwere Artikel erfordern unter Umständen eine Speditionslieferung — kontaktieren Sie uns für ein Versandangebot und die Lieferzeit. 2 Jahre eingeschränkte Garantie mit erweitertem RMA-Support; Garantieverlängerung verfügbar.
Nicht ganz das, was Sie brauchen?
Nennen Sie uns Ihren Workload, und wir legen diese Plattform darauf aus – GPUs, Arbeitsspeicher, Storage und Kühlung passend zu Ihrem tatsächlichen Betrieb.