NVIDIA L4 24GB GDDR6 Low-Profile-Passiv-GPU
Kentino · Individueller KI-Server

NVIDIA L4 24 GB GDDR6 — Low Profile, passiv

Plattform in Enterprise-Qualität, in der EU montiert und getestet.

€2.657,42 zzgl. MwSt. · Versand an der Kasse berechnet
Auf Lager — Versand aus dem EU-Lager
ISO 9001 · geprüfte HardwareEU-Lager & Garantie7+ Jahre in Enterprise-KIBurn-in-getestet vor dem Versand
Übersicht
FAQ
Versand & Garantie
Ada Lovelace · 24 GB · 72 W · Low Profile

NVIDIA L4 24 GB — die 72-W-Inferenzkarte

Eine passiv gekühlte Rechenzentrums-GPU im Single-Slot-Low-Profile-Format, die ihre 72 W direkt aus dem PCIe-Steckplatz bezieht – ohne Stromkabel und ohne zusätzliche Luftführung. Der dichteste Weg, einem Server 24 GB Inferenzkapazität hinzuzufügen.

24 GB
GDDR6 ECC VRAM
7,680
CUDA-Kerne
72 W
Aus dem Steckplatz versorgt
1 Slot
Low Profile, passiv
Überblick

Dichte und Effizienz statt Spitzendurchsatz

Die L4 folgt einer anderen Priorität als die großen Beschleunigerkarten: Leistung pro Watt und pro Steckplatz. Bei 72 W benötigt sie überhaupt keinen zusätzlichen Stromanschluss, und als Single-Slot-Karte im Low-Profile-Format passt sie in Gehäuse, die eine Full-Height-Karte schlicht nicht aufnehmen können. Genau diese Kombination macht sie zur praktikablen Wahl, um viele unabhängige Inferenz-Workloads in einem Server zu bündeln oder kompakten und Edge-Systemen leistungsfähige KI-Beschleunigung hinzuzufügen, wenn Strom und Bauraum die begrenzenden Faktoren sind. Zugleich ist sie eine starke Videokarte – Hardware-Encoding und -Decoding inklusive AV1 –, was sie zu einer häufigen Wahl für Transcoding parallel zur Inferenz macht.

Spezifikationen

Technische Daten

GPU NVIDIA AD104 — Ada Lovelace
Artikelnummer TCSL4PCIE-PB
Speicher 24 GB GDDR6 mit ECC
Speicherbandbreite ~300 GB/s
CUDA-Kerne 7,680
Tensor-Kerne 240 (4. Gen.) · ~242 TOPS INT8
RT-Kerne 60 (3. Gen.)
Schnittstelle PCIe 4.0 ×16
Leistungsaufnahme der Karte 72 W — aus dem Steckplatz bezogen, ohne Stromanschluss
Bauform Single-Slot, Low Profile, volle Baulänge
Kühlung Passiv — erfordert Gehäuseluftstrom
Displayausgänge Keine — reine Rechenkarte
Video-Engines Hardware-Encoding / -Decoding inkl. AV1
Garantie 36 Monate
Am besten geeignet für

Wo sie passt

  • Bereitstellung kleiner und mittelgroßer Modelle — 24 GB fassen ein quantisiertes 7B–13B-Modell bequem.
  • Inferenzserver mit vielen GPUs: Bei 72 W je Karte lassen sich mehrere unterbringen, ohne Strom- und Kühlkonzept neu zu planen.
  • Low-Profile- und Kompaktgehäuse, die keine Full-Height-Dual-Slot-Karte aufnehmen können.
  • Video-Transcoding-Pipelines, inklusive AV1, parallel zur Inferenz auf derselben Karte.
  • Edge- und On-Premise-Installationen mit gedeckelter Gesamtleistungsaufnahme.
Die L4 ist eine Karte für Kapazität und Effizienz, kein Durchsatz-Champion. Für aufwendiges Fine-Tuning, Arbeit mit großen Modellen oder maximale Tokens pro Sekunde sind eine RTX PRO 6000 oder ein Multi-GPU-Aufbau die bessere Investition — nennen Sie uns den Workload, und wir weisen Ihnen den passenden Weg.
Fragen

FAQ

Benötigt sie ein Stromkabel?

Nein. Die gesamte Karte bleibt innerhalb des 75-W-Budgets des PCIe-Steckplatzes, es gibt also keinen 8-Pin- oder 12-Pin-Anschluss zu verlegen. Das macht einen großen Teil ihres Reizes in dichten Aufbauten aus — die Netzteilverkabelung fällt als Einschränkung komplett weg.

Kühlt sie sich selbst?

Nein. Wie andere Rechenzentrumskarten ist sie passiv und auf den Luftstrom des Gehäuses angewiesen. In einem Server mit sauberem Front-to-Back-Luftweg ist das ideal; in einem leisen Desktop-Gehäuse überhitzt sie. Fragen Sie uns, wenn Sie sich bei Ihrem Gehäuse unsicher sind.

Welche Modellgrößen passen in 24 GB?

Ein quantisiertes 7B–13B-Modell passt mit Reserve für Kontext. Ein 70B-Modell nicht — dafür sind bei 4 Bit rund 40 GB nötig, hier sollten Sie eine 96-GB-Karte oder eine Multi-GPU-Konfiguration in Betracht ziehen.

Wie schlägt sie sich im Vergleich zur L40?

Die L40 bietet 48 GB und deutlich mehr Rechenleistung, bei rund 300 W und einer Full-Height-Dual-Slot-Bauform. Die L4 tauscht diesen Durchsatz gegen 72 W, einen Steckplatz und Low Profile. Wählen Sie die L4, wenn Leistungsaufnahme und Packungsdichte den Aufbau bestimmen, und die L40, wenn Sie die Performance brauchen.

Kann ich mehrere in einen Server einbauen?

Ja, und genau hier spielt die L4 ihre Stärken aus — mehrere Karten mit je 72 W bleiben innerhalb von Budgets, die mit Hochleistungs-GPUs unmöglich wären. Kentino baut Multi-L4-Inferenzserver, falls Sie lieber die fertige Maschine kaufen möchten.

Wie lang ist die Lieferzeit?

Auftragsbezogene Beschaffung, typischerweise 10–21 Tage. Lassen Sie sich von uns die aktuelle Verfügbarkeit bestätigen, bevor Sie einen Termin einplanen.

Sie möchten die Karte in einer fertigen Maschine? Kentino baut, benchmarkt und nimmt Multi-L4-Inferenzserver in Betrieb — fragen Sie uns nach einem konfigurierten Aufbau.

Die Fragen, die uns Käufer vor der Bestellung eines Servers am häufigsten stellen.

Wie lange dauert es?

Maschinen aus Komponenten, die wir vorrätig haben, werden schnell versandt; alles, was eine bestimmte GPU-Generation erfordert, hängt von der Verfügbarkeit ab. Wir nennen Ihnen ein Datum, bevor Sie zahlen, und wenn es sich verschiebt, sagen wir es Ihnen, statt Sie es selbst herausfinden zu lassen.

Kann die Konfiguration vor dem Bau noch geändert werden?

Fast immer. GPUs, Arbeitsspeicher, Storage und Kühlung werden je Bestellung ausgewählt, und die angegebene Konfiguration ist ein Ausgangspunkt und kein festes Paket. Wenn Sie mehr VRAM, schnelleren Storage oder ein anderes Kühlkonzept benötigen, sagen Sie es vor der Bestellung – wir kalkulieren die Änderung.

Kann ich den Server persönlich abholen?

Das können Sie. Unser Lager befindet sich in Prag, und die persönliche Abholung ist willkommen – die meisten, die vorbeikommen, nutzen den Besuch, um die Maschine gemeinsam mit unserem Ingenieur durchzugehen und die Fragen zu stellen, die per E-Mail unangenehm sind. Bei Bestellungen innerhalb Tschechiens versuchen wir außerdem, persönlich zu liefern und Sie vor Ort durch die Einrichtung zu führen.

Kann ich mit jemandem sprechen, der den Workload wirklich versteht?

Ja. Bei uns arbeitet ein Ingenieur speziell an KI-Systemen, kein allgemeines Vertriebsteam. Wenn Ihre Frage Batch-Größen, Quantisierung, Interconnect oder die Frage betrifft, wo Ihr Engpass liegen wird, stellen Sie sie — dieses Gespräch verändert die Konfiguration meist zum Besseren.

Welches Modell kann ich auf dieser Konfiguration betreiben?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Wie testen Sie einen Server vor dem Versand?

Wir testen ihn mit echten KI-Workloads statt mit synthetischen Benchmarks: Inferenz-Durchsatz, Verhalten unter Dauerlast und Thermik im Dauerbetrieb. Die Benchmark-Ergebnisse erhalten Sie zusammen mit der Maschine, sodass Sie die zugesagte Leistung vom ersten Tag an selbst überprüfen können.

Ist der Server bei Lieferung betriebsbereit?

Ja. Jede Maschine wird montiert, einem Burn-in-Test unterzogen und mit realen KI-Workloads gebenchmarkt, bevor sie ausgeliefert wird — und sie verlässt uns mit einem bereits installierten und laufenden LLM. Sie schließen sie an, verbinden sie mit Ihrem Netzwerk und legen los — die einzige verbleibende Entscheidung ist, welches Projekt zuerst darauf läuft.

Versand aus unserem EU-Lager. Schwere Artikel erfordern unter Umständen eine Speditionslieferung — kontaktieren Sie uns für ein Versandangebot und die Lieferzeit. 2 Jahre eingeschränkte Garantie mit erweitertem RMA-Support; Garantieverlängerung verfügbar.

Nicht ganz das, was Sie brauchen?

Nennen Sie uns Ihren Workload, und wir legen diese Plattform darauf aus – GPUs, Arbeitsspeicher, Storage und Kühlung passend zu Ihrem tatsächlichen Betrieb.