NVIDIA CMP 170HX 64 GB HBM2e (modifiziert, Ex-Mining)
NVIDIA CMP 170HX 64 GB HBM2e (modifiziert, Ex-Mining)
NVIDIA CMP 170HX 64 GB HBM2e (modifiziert, Ex-Mining)
NVIDIA CMP 170HX 64 GB HBM2e (modifiziert, Ex-Mining)
NVIDIA CMP 170HX 64 GB HBM2e (modifiziert, Ex-Mining)
Kentino · Individueller KI-Server

NVIDIA CMP 170HX 64 GB HBM2e (modifiziert, Ex-Mining)

Plattform in Enterprise-Qualität, in der EU montiert und getestet.

€2.600,00 zzgl. MwSt. · Versand an der Kasse berechnet
Auf Lager — Versand aus dem EU-Lager
PCIe-Schnittstelle
ISO 9001 · geprüfte HardwareEU-Lager & Garantie7+ Jahre in Enterprise-KIBurn-in-getestet vor dem Versand
Übersicht
FAQ
Versand & Garantie
Modifiziert · Ex-Mining · 64 GB HBM2e

NVIDIA CMP 170HX 64 GB HBM2e — günstiger VRAM für residente Inferenz

Eine CMP 170HX auf GA100-Basis, deren Speicher auf 64 GB HBM2e erweitert wurde. Bei €1,600 sind das rund €25 pro Gigabyte VRAM mit hoher Bandbreite — etwa ein Fünftel dessen, was professionelle Karten mit großem VRAM kosten. Es handelt sich um modifizierte Hardware mit realen Einschränkungen, und wir benennen diese nachfolgend klar, bevor Sie kaufen.

64 GB
HBM2e VRAM
GA100
Ampere GPU
~25 €/GB
VRAM-Kosten
PCIe 1.0
×4- oder ×16-Link
Bitte zuerst lesen

Was diese Karte ist — und was nicht

Die CMP 170HX wurde von NVIDIA als reine Mining-Karte verkauft: ein beschnittener GA100, dessen PCIe-Anbindung bewusst auf PCIe 1.0 festgelegt ist und bei dem die meisten Display- und Compute-Funktionen eingeschränkt sind. Diese Exemplare wurden nachträglich modifiziert, um 64 GB HBM2e aufzunehmen. Damit sind sie ein ungewöhnlich günstiger Weg, ein großes Modell vollständig im Speicher mit hoher Bandbreite zu halten — und eine schlechte Wahl für alles, was von schnellen Transfers zum Host, von Multi-GPU-Skalierung oder von Training abhängt.

Dies ist modifizierte Hardware, die außerhalb ihrer vorgesehenen Konfiguration betrieben wird. Die Recheneinheiten sind gegenüber einer vollwertigen A100 teilweise deaktiviert; der Kaufgrund sollte daher die VRAM-Kapazität sein — nicht der Durchsatz. Die einzelnen Karten unterscheiden sich: Manche sind weiter entsperrt als andere, und wir können nicht zusagen, welches Exemplar Sie erhalten. Wenn Sie garantierte, planbare Rechenleistung benötigen, kaufen Sie stattdessen eine RTX PRO 6000 oder eine echte Rechenzentrumskarte — wir erstellen Ihnen dafür gern ein Angebot.
Die PCIe-Beschränkung

Warum die ×16-Variante €150 mehr kostet

Beide Varianten sind auf PCIe-1.0-Signalisierung festgelegt — daran lässt sich nichts ändern. Unterschiedlich ist die Anzahl der Lanes, und sie verändert die Bandbreite zwischen Host und Karte um den Faktor 4×:

PCIe 1.0 ×4 — €1,600 ~1 GB/s · das Befüllen von 64 GB dauert rund eine Minute
PCIe 1.0 ×16 — €1,750 ~4 GB/s · das Befüllen von 64 GB dauert rund 15 Sekunden
Sobald die Gewichte im VRAM liegen, läuft die Inferenz aus dem HBM2e und die PCIe-Anbindung spielt kaum noch eine Rolle. Die Geschwindigkeit der Anbindung bestimmt vor allem die Ladezeit des Modells, das Streaming zwischen Host↔Gerät sowie jede Multi-GPU-Kommunikation. Wenn Sie ein Modell einmal laden und es stundenlang bereitstellen, genügt ×4. Wenn Sie häufig Modelle wechseln, fortlaufend Daten streamen oder ein Modell über mehrere Karten verteilen möchten, investieren Sie die €150.
Beide Varianten stammen aus derselben Kartencharge — die Umrüstung auf ×16 führen wir vor dem Versand im eigenen Haus durch, und genau das deckt der Aufpreis von €150 ab. Planen Sie bei ×16-Bestellungen etwas zusätzliche Zeit für die Umrüstung und die erneute Prüfung ein.
Spezifikationen

Technische Daten

GPU NVIDIA GA100 — Ampere
Speicher 64 GB HBM2e (modifiziert — keine Serienkonfiguration)
Rechenleistung Gegenüber der A100 teilweise deaktiviert — auf Kapazität ausgelegt, nicht auf Durchsatz
Schnittstelle PCIe 1.0 ×4 oder PCIe 1.0 ×16 (oben auswählen)
Host-Bandbreite ~1 GB/s (×4) · ~4 GB/s (×16)
Displayausgänge Keine — reine Rechenkarte
Kühlung Passiv — erfordert Luftstrom im Gehäuse
Zustand Gebraucht, aus dem Mining — vor dem Versand geprüft
Am besten geeignet für

Wo sie passt

  • Bereitstellung eines großen Modells, das dauerhaft im VRAM bleibt — einmal laden, stundenlang betreiben.
  • Experimente mit großen Modellen bei knappem Budget, bei denen 64 GB für €1,600 genau der springende Punkt sind.
  • Batch-Inferenz-Jobs, die durch den VRAM und nicht durch die Übertragung begrenzt sind.
  • Einarbeitung und Entwicklung an Workflows mit großen Modellen, ohne Ausgaben für Rechenzentrums-GPUs.

Wo sie nicht passt

  • Training oder Fine-Tuning — PCIe 1.0 und die reduzierte Rechenleistung wirken beide gegen Sie.
  • Tensorparallele Multi-GPU-Setups — die Verbindung ist bei Weitem zu langsam.
  • Workloads, die fortlaufend Daten aus dem Host-Speicher oder vom Datenträger streamen.
  • Alles, was eine Bildausgabe benötigt, oder eine Karte, auf die Sie sich über Jahre im Produktivbetrieb verlassen müssen.
Fragen

FAQ



Erkennt mein Framework alle 64 GB?

In unseren Tests ist die volle Kapazität adressierbar — und genau das ist der Grund, diese Karte zu kaufen. Die Rechenleistung ist eine andere Sache: Sie ist gegenüber einer echten A100 teilweise eingeschränkt, und die Karten unterscheiden sich von Exemplar zu Exemplar. Nennen Sie uns vor der Bestellung Ihren geplanten Workload, und wir geben Ihnen eine klare Antwort darauf, ob dies die richtige Anschaffung ist.

Kann ich eine vollständig entsperrte Karte bekommen?

Manche Exemplare sind weniger stark eingeschränkt als andere, doch das ist tatsächlich Glückssache, und wir verkaufen Ihnen kein Versprechen, das wir nicht halten können. Bestellen Sie auf Basis von 64 GB VRAM zu einem niedrigen Preis; alles darüber hinaus betrachten Sie als Zugabe.

Kann ich mehrere Karten in einem Rechner betreiben?

Physisch ja, und jede Karte behält ihre eigenen 64 GB, sodass unabhängige Jobs pro Karte funktionieren. Was nicht gut funktioniert, ist die Aufteilung eines einzelnen Modells auf mehrere Karten — PCIe 1.0 macht die tensorparallele Kommunikation mit deutlichem Abstand zum Flaschenhals.

Benötigt sie eine besondere Kühlung?

Ja. Es handelt sich um eine passive Karte ohne eigenen Lüfter, die ein Servergehäuse mit einer ordentlichen Luftführung von vorne nach hinten voraussetzt. In einem normalen Desktop-Gehäuse überhitzt sie.

Wie schneidet sie im Vergleich zu einer professionellen Karte ab?

Beim VRAM-Preis kommt nichts heran — hier rund €25/GB gegenüber etwa €141/GB bei einer RTX PRO 6000 mit 96 GB. Bei Zuverlässigkeit, Rechenleistung, Garantie, PCIe-Bandbreite und Wiederverkaufswert gewinnt die professionelle Karte in jedem einzelnen Punkt. Entscheiden Sie danach, was davon für Sie zählt.

Sie sind unsicher, ob dies die richtige Karte für Ihren Workload ist? Nennen Sie uns das Modell und wie Sie es bereitstellen möchten, und wir sagen Ihnen ehrlich, ob diese Karte oder ein Kentino AI Build besser passt.

Die Fragen, die uns Käufer vor der Bestellung eines Servers am häufigsten stellen.

Wie lange dauert es?

Maschinen aus Komponenten, die wir vorrätig haben, werden schnell versandt; alles, was eine bestimmte GPU-Generation erfordert, hängt von der Verfügbarkeit ab. Wir nennen Ihnen ein Datum, bevor Sie zahlen, und wenn es sich verschiebt, sagen wir es Ihnen, statt Sie es selbst herausfinden zu lassen.

Kann die Konfiguration vor dem Bau noch geändert werden?

Fast immer. GPUs, Arbeitsspeicher, Storage und Kühlung werden je Bestellung ausgewählt, und die angegebene Konfiguration ist ein Ausgangspunkt und kein festes Paket. Wenn Sie mehr VRAM, schnelleren Storage oder ein anderes Kühlkonzept benötigen, sagen Sie es vor der Bestellung – wir kalkulieren die Änderung.

Kann ich den Server persönlich abholen?

Das können Sie. Unser Lager befindet sich in Prag, und die persönliche Abholung ist willkommen – die meisten, die vorbeikommen, nutzen den Besuch, um die Maschine gemeinsam mit unserem Ingenieur durchzugehen und die Fragen zu stellen, die per E-Mail unangenehm sind. Bei Bestellungen innerhalb Tschechiens versuchen wir außerdem, persönlich zu liefern und Sie vor Ort durch die Einrichtung zu führen.

Kann ich mit jemandem sprechen, der den Workload wirklich versteht?

Ja. Bei uns arbeitet ein Ingenieur speziell an KI-Systemen, kein allgemeines Vertriebsteam. Wenn Ihre Frage Batch-Größen, Quantisierung, Interconnect oder die Frage betrifft, wo Ihr Engpass liegen wird, stellen Sie sie — dieses Gespräch verändert die Konfiguration meist zum Besseren.

Welches Modell kann ich auf dieser Konfiguration betreiben?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Wie testen Sie einen Server vor dem Versand?

Wir testen ihn mit echten KI-Workloads statt mit synthetischen Benchmarks: Inferenz-Durchsatz, Verhalten unter Dauerlast und Thermik im Dauerbetrieb. Die Benchmark-Ergebnisse erhalten Sie zusammen mit der Maschine, sodass Sie die zugesagte Leistung vom ersten Tag an selbst überprüfen können.

Ist der Server bei Lieferung betriebsbereit?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Versand aus unserem EU-Lager. Schwere Artikel erfordern unter Umständen eine Speditionslieferung — kontaktieren Sie uns für ein Versandangebot und die Lieferzeit. 2 Jahre eingeschränkte Garantie mit erweitertem RMA-Support; Garantieverlängerung verfügbar.

Nicht ganz das, was Sie brauchen?

Nennen Sie uns Ihren Workload, und wir legen diese Plattform darauf aus – GPUs, Arbeitsspeicher, Storage und Kühlung passend zu Ihrem tatsächlichen Betrieb.