NVIDIA RTX PRO 6000 Blackwell Max-Q 96GB GDDR7 ECC Grafikkarte
Kentino · Individueller KI-Server

NVIDIA RTX PRO 6000 Blackwell Max-Q 96 GB GDDR7 ECC

Plattform in Enterprise-Qualität, in der EU montiert und getestet.

€22.000,00 zzgl. MwSt. · Versand an der Kasse berechnet
Auf Lager — Versand aus dem EU-Lager
ISO 9001 · geprüfte HardwareEU-Lager & Garantie7+ Jahre in Enterprise-KIBurn-in-getestet vor dem Versand
Übersicht
FAQ
Versand & Garantie
Blackwell · 96 GB ECC · 300 W

NVIDIA RTX PRO 6000 Blackwell Max-Q — 96 GB für KI im eigenen Rechenzentrum

Die volle 96-GB-Blackwell-GPU in einem 300-W-Budget. Derselbe einheitliche ECC-VRAM-Pool und dasselbe Rechen-Silizium wie bei der 600-W-Karte, bei halber Leistungsaufnahme — die richtige Karte, wenn Temperatur, Geräusch oder ein gemeinsam genutztes Workstation-Gehäuse die Grenze setzen.

96 GB
GDDR7 ECC VRAM
24,064
CUDA-Kerne
~1.8 TB/s
Speicherbandbreite
300 W
Board-Leistung
Überblick

96 GB Unified VRAM bei 300 W

Die Max-Q-Variante trägt denselben Blackwell-Die und dieselben 96 GB ECC-GDDR7 wie die RTX PRO 6000 mit voller Leistung, ist jedoch auf 300 W begrenzt. Das wiegt schwerer, als die Überschrift vermuten lässt: Eine einzelne Karte hält ein Modell der 70B-Klasse in 4 Bit vollständig in einem einheitlichen Speicherpool — kein Tensor-Parallel-Split, kein PCIe-Hop zwischen GPUs, keine Partitionierungsarbeit. Gegenüber dem Stapeln von Consumer-Karten für dieselbe VRAM-Menge erhalten Sie ECC-Speicher, einen Bruchteil der Leistungsaufnahme und einen statt mehrerer Steckplätze.

Spezifikationen

Technische Daten

GPU NVIDIA GB202 — Blackwell
Teilenummer 900-5G153
Speicher 96 GB GDDR7 ECC, 512 Bit
Speicherbandbreite ~1.8 TB/s
CUDA-Kerne 24,064
Tensor-Kerne 752 (5. Gen) · ~2,000 TOPS INT8
RT-Kerne 188 (4. Gen)
Schnittstelle PCIe 5.0 ×16
Board-Leistung 300 W (16-Pin 12V-2×6)
Kühlung Aktiver Radiallüfter, Dual-Slot
Display-Anschlüsse 4× DisplayPort 2.1b
Garantie 36 Monate
Ideal für

Wo sie passt

  • 70B-Inferenz auf einer einzigen Karte — 96 GB fassen ein 70B-Modell in 4 Bit in einem einheitlichen Pool, ohne das Modell aufzuteilen.
  • Leise Workstations und Büros, in denen eine 600-W-Karte zu viel Wärme und Geräusch erzeugt.
  • Multi-GPU-Systeme mit begrenztem Leistungsbudget — vier Max-Q ziehen etwa so viel wie zwei Karten mit voller Leistung.
  • Fine-Tuning mittelgroßer Modelle, bei dem ECC-Speicher und Langzeitstabilität zählen.
  • Bild- und Videogenerierung mit großen Modellen, die dauerhaft im VRAM liegen.
Richtwert für den Durchsatz im Einzelstrom: rund 25–35 tok/s bei einem 70B-Modell in 4 Bit und deutlich über 100 tok/s bei einem 8B-Modell. Die Angaben sind Richtwerte aus veröffentlichten externen Quellen und wurden nicht auf Kentino-Hardware gemessen — nennen Sie uns Ihr Modell und Ihre Kontextlänge, und wir legen die Konfiguration passend aus.
Fragen

FAQ

Worin unterscheidet sich die Max-Q von der 600-W-Karte?

Dieselbe GPU, dieselben 96 GB ECC-GDDR7, dieselbe Speicherbandbreite. Die Max-Q ist auf 300 W statt 600 W begrenzt, weshalb der Dauerdurchsatz bei rechenlastigen Aufgaben geringer ausfällt — aber jedes Modell, das in 96 GB passt, passt weiterhin, und die VRAM-Kapazität entscheidet in der Regel darüber, ob ein Modell überhaupt läuft.

Kann eine einzelne Karte wirklich ein 70B-Modell betreiben?

Ja. Ein 70B-Modell in 4 Bit benötigt rund 40 GB und passt damit in 96 GB, mit reichlich Platz für KV-Cache und langen Kontext. Genau das ist der wichtigste Grund, diese Karte mehreren kleineren vorzuziehen.

Brauche ich ECC-Speicher?

Für interaktives Arbeiten nicht. Für unbeaufsichtigte Trainingsläufe, lange Batch-Jobs oder alles, bei dem ein unbemerkter Bit-Kipper ein Ergebnis verfälschen würde, macht ECC den Unterschied zwischen einer verlässlichen Maschine und einem unerklärlichen Fehler.

Passt sie in mein Gehäuse?

Es handelt sich um eine aktiv gekühlte Dual-Slot-Karte, die damit in gängige Tower- und 4U-Systeme passt. Stellen Sie sicher, dass ein freier PCIe-5.0-×16-Steckplatz und ein 16-Pin-Stromanschluss (12V-2×6) zur Verfügung stehen.

Wie lang ist die Lieferzeit?

Diese Karten werden auftragsbezogen beschafft — in der Regel 10–21 Tage. Die Verfügbarkeit dieses Artikels ändert sich schnell, fragen Sie daher bei uns nach einer Bestätigung, bevor Sie einen Termin darauf aufbauen.

Sie möchten diese Karte in einer fertigen Maschine? Kentino baut, benchmarkt und nimmt komplette KI-Server und Workstations mit RTX PRO 6000 in Betrieb — fragen Sie uns nach einem konfigurierten System.

Die Fragen, die uns Käufer vor der Bestellung eines Servers am häufigsten stellen.

Wie lange dauert es?

Maschinen aus Komponenten, die wir vorrätig haben, werden schnell versandt; alles, was eine bestimmte GPU-Generation erfordert, hängt von der Verfügbarkeit ab. Wir nennen Ihnen ein Datum, bevor Sie zahlen, und wenn es sich verschiebt, sagen wir es Ihnen, statt Sie es selbst herausfinden zu lassen.

Kann die Konfiguration vor dem Bau noch geändert werden?

Fast immer. GPUs, Arbeitsspeicher, Storage und Kühlung werden je Bestellung ausgewählt, und die angegebene Konfiguration ist ein Ausgangspunkt und kein festes Paket. Wenn Sie mehr VRAM, schnelleren Storage oder ein anderes Kühlkonzept benötigen, sagen Sie es vor der Bestellung – wir kalkulieren die Änderung.

Kann ich den Server persönlich abholen?

Das können Sie. Unser Lager befindet sich in Prag, und die persönliche Abholung ist willkommen – die meisten, die vorbeikommen, nutzen den Besuch, um die Maschine gemeinsam mit unserem Ingenieur durchzugehen und die Fragen zu stellen, die per E-Mail unangenehm sind. Bei Bestellungen innerhalb Tschechiens versuchen wir außerdem, persönlich zu liefern und Sie vor Ort durch die Einrichtung zu führen.

Kann ich mit jemandem sprechen, der den Workload wirklich versteht?

Ja. Bei uns arbeitet ein Ingenieur speziell an KI-Systemen, kein allgemeines Vertriebsteam. Wenn Ihre Frage Batch-Größen, Quantisierung, Interconnect oder die Frage betrifft, wo Ihr Engpass liegen wird, stellen Sie sie — dieses Gespräch verändert die Konfiguration meist zum Besseren.

Welches Modell kann ich auf dieser Konfiguration betreiben?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Wie testen Sie einen Server vor dem Versand?

Wir testen ihn mit echten KI-Workloads statt mit synthetischen Benchmarks: Inferenz-Durchsatz, Verhalten unter Dauerlast und Thermik im Dauerbetrieb. Die Benchmark-Ergebnisse erhalten Sie zusammen mit der Maschine, sodass Sie die zugesagte Leistung vom ersten Tag an selbst überprüfen können.

Ist der Server bei Lieferung betriebsbereit?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Versand aus unserem EU-Lager. Schwere Artikel erfordern unter Umständen eine Speditionslieferung — kontaktieren Sie uns für ein Versandangebot und die Lieferzeit. 2 Jahre eingeschränkte Garantie mit erweitertem RMA-Support; Garantieverlängerung verfügbar.

Nicht ganz das, was Sie brauchen?

Nennen Sie uns Ihren Workload, und wir legen diese Plattform darauf aus – GPUs, Arbeitsspeicher, Storage und Kühlung passend zu Ihrem tatsächlichen Betrieb.