Home-KI-Server — Punkstation Pro - 88 GB VRAM - EPYC
Plattform in Enterprise-Qualität, in der EU montiert und getestet.
Die Punkstation auf einer Server-Plattform: eine Consumer-RTX 4090 kombiniert mit einer treiberseitig entsperrten NVIDIA CMP 170HX (64 GB HBM2e) — 88 GB aggregierter VRAM — auf einem Single-Socket-AMD-EPYC-Board mit ECC-Speicher, IPMI-Fernwartung und vier PCIe 4.0 ×16 Steckplätzen für künftigen Ausbau. Kein Budget-Desktop — eine robuste, erweiterbare Maschine, aufgebaut und konfiguriert für maximale Leistung. Erhältlich als leiser Tower oder als Server für den Rack-Einbau.
Wofür sie gedacht ist
Dieselben Stärken beim aggregierten VRAM wie die Punkstation, auf Hardware, die hält und mitwächst. Der VRAM ist aggregiert, nicht gepoolt — die beiden Karten haben voneinander unabhängige Speicher. Ihre Stärken liegen daher bei Video- und Bildgenerierung, bei großen Mixture-of-Experts-Modellen, die auf eine Karte passen, sowie bei Mixture-of-Agents- und Multi-Modell-Pipelines. Die RTX 4090 treibt den Desktop und die schnelle Bildgenerierung an; die 64 GB der 170HX tragen das große Modell. Die EPYC-Plattform ergänzt ECC-Speicher, Out-of-Band-Verwaltung per IPMI, mehr PCIe-Lanes und NVMe sowie einen klaren Upgrade-Pfad zum Aufbau mit 4× 170HX.
BildgenerierungMixture-of-AgentsVideogenerierungMoE-Reasoning
- Validiert: Qwen3 35B-A3B (Mixture-of-Experts, W8A8, kompiliert) läuft vollständig in den 64 GB der 170HX ohne Auslagerung und erreicht ~140 Tokens/s im Einzelstream (und ~3,270 Tok/s über einen Batch mit 48 Anfragen) — schneller als ein dichtes 7B-Modell und dabei kohärent im Reasoning.
- Video / Bild: Generative Modelle lassen sich nicht über mehrere Karten aufteilen — jedes muss auf eine GPU passen. Die 64 GB der 170HX nehmen große Diffusions- und Videomodelle bei hoher Auflösung und Batchgröße auf; die 4090 liefert schnelle Bildgenerierung der SDXL-/Flux-Klasse. Betreiben Sie beide parallel für gleichzeitige Jobs.
Spezifikation
| Komponente | Detail |
|---|---|
| Beschleuniger 1 | NVIDIA GeForce RTX 4090 · 24 GB GDDR6X · treibt das Display und schnelle Einzelkarten-Aufgaben an |
| Beschleuniger 2 | NVIDIA CMP 170HX · 64 GB HBM2e (modifiziert, treiberseitig entsperrt, reine Compute-Karte) |
| VRAM gesamt | 88 GB aggregiert (24 + 64), beide vollständig nutzbar |
| CPU | AMD EPYC (Rome / Milan, SP3) — Modell nach Bestellung konfiguriert |
| Mainboard | Single-Socket-EPYC-Serverboard · 8-Kanal-DDR4-ECC · 4× PCIe 4.0 ×16 · Onboard-Grafik + IPMI/BMC-Fernwartung |
| Arbeitsspeicher | DDR4 ECC, Octa-Channel — konfigurierbar (typischerweise 128 GB) |
| Speicher | M.2 NVMe (bis zu 3× PCIe 4.0 ×4) |
| Netzwerk | Zwei 2.5-GbE-Ports + dedizierter IPMI-Port für die Fernwartung |
| Stromversorgung | Leistungsstärkeres Netzteil, passend zum Aufbau dimensioniert |
| Gehäuse | Leiser Desktop-Tower — oder Server für den Rack-Einbau (oben auswählen) |
| Betriebssystem | Ubuntu, NVIDIA-Treiber + CUDA vorkonfiguriert, Compiled-/CUDA-Graph-Runtime abgestimmt |
| Aufbau | Vor dem Versand aufgebaut, eingebrannt und bei maximaler Leistung validiert |
Bitte vor der Bestellung lesen
- Die 170HX ist eine reine Compute-Karte (ohne Displayausgang) — die Konsole wird von der RTX 4090 (oder der Onboard-BMC-Grafik) angesteuert.
- Die 170HX bindet mit PCIe 2.0 an (×4 standardmäßig, ×16 als Mod verfügbar) — das begrenzt die Übertragung zwischen Host und Gerät, nicht die Inferenz eines resident geladenen Modells.
Bestellung
Preis in Vorbereitung — fordern Sie ein Angebot an. Wählen Sie oben Tower oder Server (Rack). Lieferzeit 10–28 Tage. Preise in EUR zzgl. MwSt. CPU, Arbeitsspeicher und Speicher werden auf Wunsch individuell konfiguriert.
Die Fragen, die uns Käufer vor der Bestellung eines Servers am häufigsten stellen.
Wie lange dauert es?
Maschinen aus Komponenten, die wir vorrätig haben, werden schnell versandt; alles, was eine bestimmte GPU-Generation erfordert, hängt von der Verfügbarkeit ab. Wir nennen Ihnen ein Datum, bevor Sie zahlen, und wenn es sich verschiebt, sagen wir es Ihnen, statt Sie es selbst herausfinden zu lassen.
Kann die Konfiguration vor dem Bau noch geändert werden?
Fast immer. GPUs, Arbeitsspeicher, Storage und Kühlung werden je Bestellung ausgewählt, und die angegebene Konfiguration ist ein Ausgangspunkt und kein festes Paket. Wenn Sie mehr VRAM, schnelleren Storage oder ein anderes Kühlkonzept benötigen, sagen Sie es vor der Bestellung – wir kalkulieren die Änderung.
Kann ich den Server persönlich abholen?
Das können Sie. Unser Lager befindet sich in Prag, und die persönliche Abholung ist willkommen – die meisten, die vorbeikommen, nutzen den Besuch, um die Maschine gemeinsam mit unserem Ingenieur durchzugehen und die Fragen zu stellen, die per E-Mail unangenehm sind. Bei Bestellungen innerhalb Tschechiens versuchen wir außerdem, persönlich zu liefern und Sie vor Ort durch die Einrichtung zu führen.
Kann ich mit jemandem sprechen, der den Workload wirklich versteht?
Ja. Bei uns arbeitet ein Ingenieur speziell an KI-Systemen, kein allgemeines Vertriebsteam. Wenn Ihre Frage Batch-Größen, Quantisierung, Interconnect oder die Frage betrifft, wo Ihr Engpass liegen wird, stellen Sie sie — dieses Gespräch verändert die Konfiguration meist zum Besseren.
Welches Modell kann ich auf dieser Konfiguration betreiben?
Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.
Wie testen Sie einen Server vor dem Versand?
Wir testen ihn mit echten KI-Workloads statt mit synthetischen Benchmarks: Inferenz-Durchsatz, Verhalten unter Dauerlast und Thermik im Dauerbetrieb. Die Benchmark-Ergebnisse erhalten Sie zusammen mit der Maschine, sodass Sie die zugesagte Leistung vom ersten Tag an selbst überprüfen können.
Ist der Server bei Lieferung betriebsbereit?
Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.
Versand aus unserem EU-Lager. Schwere Artikel erfordern unter Umständen eine Speditionslieferung — kontaktieren Sie uns für ein Versandangebot und die Lieferzeit. 2 Jahre eingeschränkte Garantie mit erweitertem RMA-Support; Garantieverlängerung verfügbar.
Nicht ganz das, was Sie brauchen?
Nennen Sie uns Ihren Workload, und wir legen diese Plattform darauf aus – GPUs, Arbeitsspeicher, Storage und Kühlung passend zu Ihrem tatsächlichen Betrieb.