NVIDIA L4 24GB GDDR6 low profile pasivní GPU
Kentino · AI server na míru

NVIDIA L4 24 GB GDDR6 — Low Profile, pasivní

Platforma podnikové třídy, sestavená a otestovaná v EU.

€2.657,42 bez DPH · dopravu spočítáme v košíku
Skladem — expedice ze skladu v EU
ISO 9001 · ověřený hardwareSklad a záruka v EU7+ let ve firemní AIPřed expedicí otestováno zátěží
Přehled
Časté dotazy
Doprava a záruka
Ada Lovelace · 24 GB · 72 W · Low Profile

NVIDIA L4 24 GB — inferenční karta se 72 W

Jednoslotová pasivně chlazená datacentrová GPU v provedení low profile, která odebírá pouhých 72 W přímo z PCIe slotu — bez napájecího kabelu a bez nároků na zvláštní proudění vzduchu. Nejhustší způsob, jak serveru přidat 24 GB inferenčního výkonu.

24 GB
GDDR6 ECC VRAM
7,680
CUDA jader
72 W
Napájení ze slotu
1 slot
Low profile, pasivní
Přehled

Hustota a účinnost, ne špičkový průtok

L4 je postavená na jiné prioritě než velké akcelerátory: na výkonu na watt a na slot. Při 72 W nepotřebuje vůbec žádný přídavný napájecí konektor a díky jednoslotovému provedení low profile se vejde i do skříní, které plnovýškovou kartu fyzicky nepřijmou. Právě tato kombinace z ní dělá praktickou volbu, když potřebujete do jednoho serveru natěsnat mnoho nezávislých inferenčních workloadů nebo přidat schopnou AI akceleraci do kompaktních a edge systémů, kde jsou limitem příkon a prostor. Je to zároveň silná video karta — hardwarové kódování i dekódování včetně AV1 — takže se často volí pro transkódování souběžně s inferencí.

Specifikace

Technické údaje

GPU NVIDIA AD104 — Ada Lovelace
Objednací číslo TCSL4PCIE-PB
Paměť 24 GB GDDR6 s ECC
Propustnost paměti ~300 GB/s
CUDA jádra 7,680
Tensor jádra 240 (4. generace) · ~242 TOPS INT8
RT jádra 60 (3. generace)
Rozhraní PCIe 4.0 ×16
Příkon karty 72 W — odebíraných ze slotu, bez napájecího konektoru
Provedení Jednoslotová, low profile, plná délka
Chlazení Pasivní — vyžaduje proudění vzduchu ve skříni
Obrazové výstupy Žádné — pouze výpočty
Video jednotky Hardwarové kódování / dekódování včetně AV1
Záruka 36 měsíců
Nejvhodnější pro

Kam se hodí

  • Provoz malých a středních modelů — 24 GB pohodlně pojme kvantizovaný model 7B–13B.
  • Inferenční servery s mnoha GPU: při 72 W na kartu jich osadíte několik, aniž byste předělávali napájení nebo chlazení.
  • Low profile a kompaktní skříně, do kterých se plnovýšková dvouslotová karta nevejde.
  • Transkódovací řetězce včetně AV1 souběžně s inferencí na téže kartě.
  • Edge a on-premise nasazení, kde je celkový příkon stropem.
L4 je karta pro kapacitu a účinnost, nikoli šampion v propustnosti. Na náročný fine-tuning, práci s velkými modely nebo maximum tokenů za sekundu jsou lepší investicí RTX PRO 6000 nebo sestava s více GPU — napište nám, o jaký workload jde, a doporučíme Vám tu správnou.
Dotazy

Časté dotazy

Potřebuje napájecí kabel?

Ne. Celá karta se vejde do 75W rozpočtu PCIe slotu, takže není třeba vést žádný 8pinový ani 12pinový konektor. To je velká část její přitažlivosti v hustých sestavách — kabeláž od zdroje přestává být omezením.

Uchladí se sama?

Ne. Jako ostatní datacentrové karty je pasivní a spoléhá na proudění vzduchu ve skříni. V serveru s pořádnou cestou vzduchu zepředu dozadu je to ideální; v tiché desktopové skříni se přehřeje. Pokud si svou skříní nejste jistí, zeptejte se nás.

Jak velké modely se vejdou do 24 GB?

Kvantizovaný model 7B–13B se vejde i s rezervou na kontext. Model 70B nikoli — ten potřebuje zhruba 40 GB při 4bitové kvantizaci, takže sáhněte raději po 96GB kartě nebo po konfiguraci s více GPU.

Jak si stojí proti L40?

L40 má 48 GB a podstatně vyšší výpočetní výkon, a to při zhruba 300 W a plnovýškovém dvouslotovém provedení. L4 tuto propustnost vyměňuje za 72 W, jeden slot a low profile. Zvolte L4, když o sestavě rozhoduje příkon a hustota, a L40, když potřebujete výkon.

Mohu jich do jednoho serveru dát několik?

Ano, a právě v tom je L4 nejlepší — několik karet po 72 W se vejde do rozpočtů, které by s energeticky náročnými GPU byly nemyslitelné. Kentino inferenční servery s více L4 staví, pokud raději koupíte hotový stroj.

Jaká je dodací lhůta?

Objednáváme na zakázku, obvykle 10–21 dní. Než začnete plánovat termín, požádejte nás o potvrzení aktuální dostupnosti.

Chcete ji rovnou v hotovém stroji? Kentino staví, benchmarkuje a uvádí do provozu inferenční servery s více L4 — napište si o nakonfigurovanou sestavu.

Otázky, které nám kupující kladou před objednávkou serveru nejčastěji.

Jak dlouho to trvá?

Stroje sestavené z komponent, které máme skladem, expedujeme rychle; cokoli, co vyžaduje konkrétní generaci GPU, závisí na dostupnosti. Termín Vám sdělíme ještě před platbou, a pokud se posune, dáme Vám vědět sami, místo abyste na to museli přijít.

Lze konfiguraci změnit ještě před sestavením?

Téměř vždy. GPU, paměť, úložiště i chlazení volíme podle konkrétní objednávky a uvedená konfigurace je spíš výchozím bodem než pevně daným balíkem. Pokud potřebujete více VRAM, rychlejší úložiště nebo jiné řešení chlazení, dejte nám vědět ještě před objednávkou a změnu Vám naceníme.

Mohu si server vyzvednout osobně?

Ano, můžete. Náš sklad je v Praze a osobní odběr vítáme — většina těch, kdo přijedou, využije návštěvu k tomu, aby si stroj prošla s naším technikem a zeptala se na věci, které se e-mailem řeší těžko. U objednávek v rámci České republiky se také snažíme doručovat osobně a provést Vás nastavením přímo na místě.

Mohu mluvit s někým, kdo opravdu rozumí workloadu?

Ano. Máme inženýra, který se věnuje přímo AI systémům, nikoli obecné obchodní oddělení. Pokud se ptáte na velikosti batchů, kvantizaci, propojení nebo na to, kde bude Vaše úzké hrdlo, zeptejte se — takový rozhovor obvykle posune konfiguraci k lepšímu.

Jaký model na této konfiguraci spustím?

Ano. Každý stroj je sestaven, podroben burn-in testu a změřen na reálných AI workloadech ještě před expedicí a odchází od nás s již nainstalovaným a běžícím LLM. Zapojíte jej, připojíte do své sítě a začnete pracovat — zbývá jediné rozhodnutí: na jakém projektu poběží jako prvním.

Jak testujete server před expedicí?

Testujeme ji na skutečných AI workloadech, ne na syntetických skóre: propustnost inference, chování při dlouhodobé zátěži a teploty v nepřetržitém provozu. Výsledky benchmarků dostanete spolu se strojem, takže si slíbený výkon můžete ověřit hned první den.

Je server po dodání připravený k provozu?

Ano. Každý stroj je sestaven, podroben burn-in testu a změřen na reálných AI workloadech ještě před expedicí a odchází od nás s již nainstalovaným a běžícím LLM. Zapojíte jej, připojíte do své sítě a začnete pracovat — zbývá jediné rozhodnutí: na jakém projektu poběží jako prvním.

Expedujeme z našeho skladu v EU. U těžkých položek může být nutná přeprava nákladní dopravou — napište si o cenovou nabídku dopravy a dodací lhůtu. Dvouletá omezená záruka s přednostním RMA servisem, prodloužená záruka na vyžádání.

Není to přesně to, co potřebujete?

Řekněte nám, jaký workload provozujete, a my Vám tuto platformu navrhneme na míru — GPU, paměť, úložiště i chlazení podle toho, co u Vás skutečně běží.