Kentino KI 192 Rome ArcProB70 TBD — 6× Intel Arc Pro B70 — EPYC Milan (Vorbestellung)
Kentino KI 192 Rome ArcProB70 TBD — 6× Intel Arc Pro B70 — EPYC Milan (Vorbestellung)
Kentino KI 192 Rome ArcProB70 TBD — 6× Intel Arc Pro B70 — EPYC Milan (Vorbestellung)
Kentino KI 192 Rome ArcProB70 TBD — 6× Intel Arc Pro B70 — EPYC Milan (Vorbestellung)
Kentino KI 192 Rome ArcProB70 TBD — 6× Intel Arc Pro B70 — EPYC Milan (Vorbestellung)
Kentino KI 192 Rome ArcProB70 TBD — 6× Intel Arc Pro B70 — EPYC Milan (Vorbestellung)
Kentino KI 192 Rome ArcProB70 TBD — 6× Intel Arc Pro B70 — EPYC Milan (Vorbestellung)
Kentino KI 192 Rome ArcProB70 TBD — 6× Intel Arc Pro B70 — EPYC Milan (Vorbestellung)
Kentino KI 192 Rome ArcProB70 TBD — 6× Intel Arc Pro B70 — EPYC Milan (Vorbestellung)
Kentino · Individueller KI-Server

Kentino KI 192 Rome ArcProB70 TBD — 6× Intel Arc Pro B70 — EPYC Milan (Vorbestellung)

Plattform in Enterprise-Qualität, in der EU montiert und getestet.

€24.803,00 zzgl. MwSt. · Versand an der Kasse berechnet
Auf Lager — Versand aus dem EU-Lager
ISO 9001 · geprüfte HardwareEU-Lager & Garantie7+ Jahre in Enterprise-KIBurn-in-getestet vor dem Versand
Übersicht
FAQ
Versand & Garantie

IN VORBEREITUNG

Vorbestellung — Intel Arc Pro B70, geplante Auslieferung Q3 2026

Kentino AI 192 Rome ArcProB70 TBD

192 GB VRAM Intel Xe2 Inferenz-Server
6x Arc Pro B70 | EPYC Milan | TOPS TBD

TBD
INT8 TOPS
192 GB
VRAM-Pool
Intel
Xe2 Battlemage
6 Karten
OpenVINO / SYCL

Preisbewusster Build mit viel VRAM, ausgelegt auf den quelloffenen Inferenz-Stack von Intel. Preisbindung ab Verfügbarkeit bei Intel.

Ein 4U-Rack-Inferenz-Server mit sechs Intel Arc Pro B70 Creator Karten (je 32 GB Xe2-HPG "Battlemage", 192 GB gesamt), einer AMD EPYC 7643 Milan CPU (48C/96T), 384 GB DDR4 ECC, 2 TB NVMe-Bootlaufwerk und einem 2-kW-ATX-Netzteil (Upgrade auf zwei Netzteile dringend empfohlen). Gebaut für das Intel-Software-Ökosystem: OpenVINO 2025+, IPEX-LLM, llama.cpp SYCL-Backend und vLLM-Intel-Forks. Reine CUDA-Workloads laufen auf dieser Hardware nicht.

Hardware

Komponente Detail
GPUs 6x Intel Arc Pro B70 Creator 32 GB (Xe2-HPG "Battlemage", 250 W, PCIe 5.0 x16, Dual-Slot)
VRAM-Pool 192 GB gesamt über 6 Karten (kein Fabric zwischen den Karten — Peer-Traffic über PCIe)
CPU AMD EPYC 7643 Milan (48C/96T, 225 W, 128x PCIe 4.0 Lanes)
Mainboard ASRock Rack ROMED8-2T (SP3, 7x PCIe 4.0 x16, 8x DDR4 ECC, 2x 10 GbE, IPMI)
System-RAM 384 GB DDR4-2666 ECC RDIMM (6x 64 GB)
Boot / Speicher 2 TB NVMe M.2 (PCIe 4.0 x4)
Netzteil 1x 2-kW-ATX-Netzteil (Upgrade auf zwei synchronisierte 2-kW-Netzteile dringend empfohlen)
Gehäuse 4U-Rack-Einbau (6-Slot-Layout)
Kühlung SP3-Tower-Kühler (Arctic Freezer 4U-M) + gerichteter Luftstrom von vorn nach hinten (Industrielüfter)
Netzwerk Onboard Dual 10 GbE (Intel X550)

Leistungsbudget

  • GPU-Aufnahme: 6 x 250 W = 1 500 W (von Intel angegebene TDP)
  • Systemleistung gesamt unter Volllast: ~1 825 W
  • Netzteil gesamt: 2 000 W (einzeln) — nur 8.75 % Reserve
  • Zwei synchronisierte 2-kW-Netzteile dringend empfohlen — stellt ~45 % Reserve her

Lane-Topologie

Das ROMED8-2T bietet 7x PCIe 4.0 x16 Lanes. Sechs Slots sind belegt, einer bleibt für eine NIC frei. Die Arc Pro B70 ist nativ PCIe Gen5, das ROMED8-2T läuft mit Gen4 — die Bandbreiteneinbuße ist bei Inferenz mit 32 GB pro Karte vernachlässigbar. Kein PCIe-Switch. Kein Äquivalent zu Xe-Link.

Was Sie darauf betreiben können

Alle Kompatibilitätsangaben beziehen sich auf Pfade im Intel-Software-Stack (OpenVINO, IPEX-LLM, llama.cpp SYCL, vLLM-Intel). Reine CUDA-Workloads laufen auf dieser Hardware nicht. Alle Angaben stammen aus veröffentlichten externen Quellen und werden nach Auslieferung der Karten unabhängig überprüft.

LLMs — Text / Reasoning / Coding

Chinesische Spitzenmodelle

  • Qwen3 / Qwen3.5 (Alibaba): Qwen3-235B-A22B Q4 (~132 GB) mit Spielraum für langen Kontext; Qwen3-Coder-480B-A35B Q2 (~160 GB); Qwen3.5-397B-A17B Q3 (~170 GB)
  • GLM / Z.ai: GLM-4.5 / 4.6 / 4.7 Q4 (~177 GB) — passt mit moderatem KV
  • Tencent Hunyuan: Hunyuan-Large Q3 (~160 GB); Hunyuan-A13B fp8 (~80 GB), sofern der Xe2-fp8-Pfad im Treiber freigeschaltet ist
  • Weitere: Baidu ERNIE-4.5-424B Q3 (~180 GB); MiniMax-M1 Q3 (~180 GB); DeepSeek-R2 32B (6x parallele Streams)

Westliche Spitzenmodelle

  • Meta Llama: Llama 3.3 70B Q6-Q8 mit großzügigem KV; Llama 4 Scout 109B/17B Q4 (~63 GB) mit reichlich Reserve
  • Mistral: Mistral Small 3 / Magistral Small / Devstral Small 2 (24B) in bf16; Pixtral Large Q4-Q6
  • OpenAI (offene Gewichte): gpt-oss-120b nativ MXFP4 (~80 GB) — sofern MXFP4-Dequantisierung im Intel-Stack verfügbar ist
  • NVIDIA Nemotron: Llama-3.1-Nemotron Ultra 253B Q4 (~120 GB)
  • Weitere: Gemma 3 27B bf16 multimodal; Phi-4 / Phi-4-reasoning 14B; Cohere Command R+ 104B Q4

Vision-Language-Modelle

Qwen3-VL-8B / 32B; Qwen3-VL-30B-A3B MoE; InternVL3 bis 78B; InternVL3.5-38B; Llama 3.2 90B Vision Q4; Pixtral 12B; Molmo 72B Q4; Gemma 3 12B/27B multimodal; MiniCPM-V 2.6 / MiniCPM-o 2.6. Das OpenVINO von Intel unterstützt Vision-Tower sehr gut — VLM dürfte hier von Tag eins an eine Stärke sein.

Bildgenerierung

FLUX.1 [dev] / [schnell] fp8 oder Q4 GGUF über llama.cpp SYCL; SDXL / SD 3.5 Large über die OpenVINO-genAI-Runtime; HunyuanDiT; HunyuanImage-2.1 bf16 (~34 GB); Kolors 2.0; AuraFlow; OmniGen; PixArt-Sigma.

Videogenerierung

Wan 2.2 T2V-A14B / I2V-A14B MoE (~54 GB bf16); Wan 2.2 TI2V-5B; HunyuanVideo 13B bf16; HunyuanVideo 1.5; CogVideoX-5B; Open-Sora 2.0; LTX-Video; Pyramid Flow; Mochi-1 Q4. Video ist derzeit der schwächste Intel-Pfad — zum Auslieferungszeitpunkt ist mit funktionierender, aber nicht durchsatzoptimierter Ausführung zu rechnen.

Audio / Sprache / TTS

  • ASR: Whisper v3 large / turbo über OpenVINO (erstklassige Whisper-Unterstützung bei Intel); Parakeet-TDT; Canary; SenseVoice
  • TTS: CosyVoice 2/3; Kokoro 82M; Stable Audio Open; XTTS v2; StyleTTS 2; Step-Audio-EditX
  • Echtzeit / S2S: Kyutai Moshi; MusicGen / AudioGen / Bark; SeamlessM4T v2

Multi-Modell- / Multi-Tenant-Serving

  • 6 parallele Streams eines 32-GB-Q4-Modells (einer pro Karte) — z. B. 6x Qwen3-32B-Q4-Agenten
  • Embedding-Flotte im großen Maßstab — 6x parallele BGE-M3- / E5- / Nomic-Embed-Streams (OpenVINO-optimiert)
  • Gemischte Belegung — 70B Q4 (tensor-parallel über 3 Karten) + FLUX.1 (1 Karte) + Whisper-turbo (1 Karte) + Moshi (1 Karte)

Zielanwendungen

  • Evaluierungspilot für Intel-Software als CUDA-Alternative beim LLM-Serving
  • Embedding- / Reranker-Backend, bei dem VRAM pro Euro wichtiger ist als reiner Durchsatz
  • Preisbewusste Q4-Inferenz von Frontier-MoE-Modellen (Qwen3-235B, GLM-4.5/4.6/4.7) für kleine interne Entwicklerteams
  • OpenVINO-native Modellbereitstellung neben bestehenden Intel-Xeon- / Arc-Pro-Pipelines
  • Backend für VLM, OCR und Dokumentenverarbeitung (eine Stärke von Intels OpenVINO)

Gemessene Leistung

Von Intel veröffentlichte Spezifikationen | Unabhängige Überprüfung nach Auslieferung der Karten

Spezifikation Wert
VRAM pro Karte 32 GB GDDR6
Speicherbandbreiten-Klasse ~450 GB/s pro Karte
Xe Matrix Extensions (XMX) Beschleunigt über OpenVINO / IPEX-LLM
fp8-Pfad Xe2-Silizium — Freigabe im Treiber zum Auslieferungszeitpunkt prüfen

Keine von Kentino gemessenen Daten. Die von Intel veröffentlichten Spezifikationen werden unabhängig überprüft. Kentino veröffentlicht eigene Werte zu tok/s, QPS und Bandbreite, sobald die erste Einheit den Burn-in bestanden hat.

Weniger geeignet für

  • CUDA-native Workloads — auf Intel gibt es kein CUDA, mit Migrationsaufwand ist zu rechnen
  • SLA-kritischen Produktivbetrieb, solange Verfügbarkeit und Tooling der Intel Arc Pro noch nicht stabil sind
  • Frontier-MoE-Modelle ab 600B bei Q4+ (erfordert 6x RTX Pro 6000 / 576 GB Pool)
  • Trainings-Workloads — die Arc Pro ist auf Inferenz ausgelegt, die Framework-Reife für verteiltes Training ist begrenzt
  • Kunden, die vor dem Kauf gemessene Benchmarks benötigen — diese SKU ist eine Vorbestellung

Garantie und Lieferzeit

2 Jahre
Garantie auf Teile
1 Jahr
Garantie auf Arbeitsleistung
Q3 2026
geplante Auslieferung

Kentino Standardgarantie (2 Jahre auf Teile, 1 Jahr auf Arbeitsleistung); strengere Bedingungen des Intel-Vertriebs gehen vor. Der Aufbau umfasst Montage, BIOS-Konfiguration, Treiberinstallation, Burn-in-Test und Funktionsprüfung. Sichern Sie sich Ihren Liefertermin aus der ersten Welle über das Kentino-Kontaktformular. 30 Tage Preisbindung ab Bestellung.

Empfohlene Erweiterungen

  • Upgrade auf zwei synchronisierte 2-kW-Netzteile (bei 1 825 W Aufnahme ist die Reserve eines einzelnen Netzteils knapp — dringend empfohlen)
  • RAM-Upgrade auf 512 GB DDR4 (2x 64 GB — zwei Slots frei)
  • 4 TB NVMe als zweites Laufwerk für die Modellbibliothek

Die Fragen, die uns Käufer vor der Bestellung eines Servers am häufigsten stellen.

Wie lange dauert es?

Maschinen aus Komponenten, die wir vorrätig haben, werden schnell versandt; alles, was eine bestimmte GPU-Generation erfordert, hängt von der Verfügbarkeit ab. Wir nennen Ihnen ein Datum, bevor Sie zahlen, und wenn es sich verschiebt, sagen wir es Ihnen, statt Sie es selbst herausfinden zu lassen.

Kann die Konfiguration vor dem Bau noch geändert werden?

Fast immer. GPUs, Arbeitsspeicher, Storage und Kühlung werden je Bestellung ausgewählt, und die angegebene Konfiguration ist ein Ausgangspunkt und kein festes Paket. Wenn Sie mehr VRAM, schnelleren Storage oder ein anderes Kühlkonzept benötigen, sagen Sie es vor der Bestellung – wir kalkulieren die Änderung.

Kann ich den Server persönlich abholen?

Das können Sie. Unser Lager befindet sich in Prag, und die persönliche Abholung ist willkommen – die meisten, die vorbeikommen, nutzen den Besuch, um die Maschine gemeinsam mit unserem Ingenieur durchzugehen und die Fragen zu stellen, die per E-Mail unangenehm sind. Bei Bestellungen innerhalb Tschechiens versuchen wir außerdem, persönlich zu liefern und Sie vor Ort durch die Einrichtung zu führen.

Kann ich mit jemandem sprechen, der den Workload wirklich versteht?

Ja. Bei uns arbeitet ein Ingenieur speziell an KI-Systemen, kein allgemeines Vertriebsteam. Wenn Ihre Frage Batch-Größen, Quantisierung, Interconnect oder die Frage betrifft, wo Ihr Engpass liegen wird, stellen Sie sie — dieses Gespräch verändert die Konfiguration meist zum Besseren.

Welches Modell kann ich auf dieser Konfiguration betreiben?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Wie testen Sie einen Server vor dem Versand?

Wir testen ihn mit echten KI-Workloads statt mit synthetischen Benchmarks: Inferenz-Durchsatz, Verhalten unter Dauerlast und Thermik im Dauerbetrieb. Die Benchmark-Ergebnisse erhalten Sie zusammen mit der Maschine, sodass Sie die zugesagte Leistung vom ersten Tag an selbst überprüfen können.

Ist der Server bei Lieferung betriebsbereit?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Versand aus unserem EU-Lager. Schwere Artikel erfordern unter Umständen eine Speditionslieferung — kontaktieren Sie uns für ein Versandangebot und die Lieferzeit. 2 Jahre eingeschränkte Garantie mit erweitertem RMA-Support; Garantieverlängerung verfügbar.

Nicht ganz das, was Sie brauchen?

Nennen Sie uns Ihren Workload, und wir legen diese Plattform darauf aus – GPUs, Arbeitsspeicher, Storage und Kühlung passend zu Ihrem tatsächlichen Betrieb.