NVIDIA L4 24 GB GDDR6 — Low Profile, pasivní
Platforma podnikové třídy, sestavená a otestovaná v EU.
NVIDIA L4 24 GB — inferenční karta se 72 W
Jednoslotová pasivně chlazená datacentrová GPU v provedení low profile, která odebírá pouhých 72 W přímo z PCIe slotu — bez napájecího kabelu a bez nároků na zvláštní proudění vzduchu. Nejhustší způsob, jak serveru přidat 24 GB inferenčního výkonu.
Hustota a účinnost, ne špičkový průtok
L4 je postavená na jiné prioritě než velké akcelerátory: na výkonu na watt a na slot. Při 72 W nepotřebuje vůbec žádný přídavný napájecí konektor a díky jednoslotovému provedení low profile se vejde i do skříní, které plnovýškovou kartu fyzicky nepřijmou. Právě tato kombinace z ní dělá praktickou volbu, když potřebujete do jednoho serveru natěsnat mnoho nezávislých inferenčních workloadů nebo přidat schopnou AI akceleraci do kompaktních a edge systémů, kde jsou limitem příkon a prostor. Je to zároveň silná video karta — hardwarové kódování i dekódování včetně AV1 — takže se často volí pro transkódování souběžně s inferencí.
Technické údaje
| GPU | NVIDIA AD104 — Ada Lovelace |
| Objednací číslo | TCSL4PCIE-PB |
| Paměť | 24 GB GDDR6 s ECC |
| Propustnost paměti | ~300 GB/s |
| CUDA jádra | 7,680 |
| Tensor jádra | 240 (4. generace) · ~242 TOPS INT8 |
| RT jádra | 60 (3. generace) |
| Rozhraní | PCIe 4.0 ×16 |
| Příkon karty | 72 W — odebíraných ze slotu, bez napájecího konektoru |
| Provedení | Jednoslotová, low profile, plná délka |
| Chlazení | Pasivní — vyžaduje proudění vzduchu ve skříni |
| Obrazové výstupy | Žádné — pouze výpočty |
| Video jednotky | Hardwarové kódování / dekódování včetně AV1 |
| Záruka | 36 měsíců |
Kam se hodí
- Provoz malých a středních modelů — 24 GB pohodlně pojme kvantizovaný model 7B–13B.
- Inferenční servery s mnoha GPU: při 72 W na kartu jich osadíte několik, aniž byste předělávali napájení nebo chlazení.
- Low profile a kompaktní skříně, do kterých se plnovýšková dvouslotová karta nevejde.
- Transkódovací řetězce včetně AV1 souběžně s inferencí na téže kartě.
- Edge a on-premise nasazení, kde je celkový příkon stropem.
Časté dotazy
Potřebuje napájecí kabel?
Ne. Celá karta se vejde do 75W rozpočtu PCIe slotu, takže není třeba vést žádný 8pinový ani 12pinový konektor. To je velká část její přitažlivosti v hustých sestavách — kabeláž od zdroje přestává být omezením.
Uchladí se sama?
Ne. Jako ostatní datacentrové karty je pasivní a spoléhá na proudění vzduchu ve skříni. V serveru s pořádnou cestou vzduchu zepředu dozadu je to ideální; v tiché desktopové skříni se přehřeje. Pokud si svou skříní nejste jistí, zeptejte se nás.
Jak velké modely se vejdou do 24 GB?
Kvantizovaný model 7B–13B se vejde i s rezervou na kontext. Model 70B nikoli — ten potřebuje zhruba 40 GB při 4bitové kvantizaci, takže sáhněte raději po 96GB kartě nebo po konfiguraci s více GPU.
Jak si stojí proti L40?
L40 má 48 GB a podstatně vyšší výpočetní výkon, a to při zhruba 300 W a plnovýškovém dvouslotovém provedení. L4 tuto propustnost vyměňuje za 72 W, jeden slot a low profile. Zvolte L4, když o sestavě rozhoduje příkon a hustota, a L40, když potřebujete výkon.
Mohu jich do jednoho serveru dát několik?
Ano, a právě v tom je L4 nejlepší — několik karet po 72 W se vejde do rozpočtů, které by s energeticky náročnými GPU byly nemyslitelné. Kentino inferenční servery s více L4 staví, pokud raději koupíte hotový stroj.
Jaká je dodací lhůta?
Objednáváme na zakázku, obvykle 10–21 dní. Než začnete plánovat termín, požádejte nás o potvrzení aktuální dostupnosti.
Otázky, které nám kupující kladou před objednávkou serveru nejčastěji.
Jak dlouho to trvá?
Stroje sestavené z komponent, které máme skladem, expedujeme rychle; cokoli, co vyžaduje konkrétní generaci GPU, závisí na dostupnosti. Termín Vám sdělíme ještě před platbou, a pokud se posune, dáme Vám vědět sami, místo abyste na to museli přijít.
Lze konfiguraci změnit ještě před sestavením?
Téměř vždy. GPU, paměť, úložiště i chlazení volíme podle konkrétní objednávky a uvedená konfigurace je spíš výchozím bodem než pevně daným balíkem. Pokud potřebujete více VRAM, rychlejší úložiště nebo jiné řešení chlazení, dejte nám vědět ještě před objednávkou a změnu Vám naceníme.
Mohu si server vyzvednout osobně?
Ano, můžete. Náš sklad je v Praze a osobní odběr vítáme — většina těch, kdo přijedou, využije návštěvu k tomu, aby si stroj prošla s naším technikem a zeptala se na věci, které se e-mailem řeší těžko. U objednávek v rámci České republiky se také snažíme doručovat osobně a provést Vás nastavením přímo na místě.
Mohu mluvit s někým, kdo opravdu rozumí workloadu?
Ano. Máme inženýra, který se věnuje přímo AI systémům, nikoli obecné obchodní oddělení. Pokud se ptáte na velikosti batchů, kvantizaci, propojení nebo na to, kde bude Vaše úzké hrdlo, zeptejte se — takový rozhovor obvykle posune konfiguraci k lepšímu.
Jaký model na této konfiguraci spustím?
Ano. Každý stroj je sestaven, podroben burn-in testu a změřen na reálných AI workloadech ještě před expedicí a odchází od nás s již nainstalovaným a běžícím LLM. Zapojíte jej, připojíte do své sítě a začnete pracovat — zbývá jediné rozhodnutí: na jakém projektu poběží jako prvním.
Jak testujete server před expedicí?
Testujeme ji na skutečných AI workloadech, ne na syntetických skóre: propustnost inference, chování při dlouhodobé zátěži a teploty v nepřetržitém provozu. Výsledky benchmarků dostanete spolu se strojem, takže si slíbený výkon můžete ověřit hned první den.
Je server po dodání připravený k provozu?
Ano. Každý stroj je sestaven, podroben burn-in testu a změřen na reálných AI workloadech ještě před expedicí a odchází od nás s již nainstalovaným a běžícím LLM. Zapojíte jej, připojíte do své sítě a začnete pracovat — zbývá jediné rozhodnutí: na jakém projektu poběží jako prvním.
Expedujeme z našeho skladu v EU. U těžkých položek může být nutná přeprava nákladní dopravou — napište si o cenovou nabídku dopravy a dodací lhůtu. Dvouletá omezená záruka s přednostním RMA servisem, prodloužená záruka na vyžádání.
Není to přesně to, co potřebujete?
Řekněte nám, jaký workload provozujete, a my Vám tuto platformu navrhneme na míru — GPU, paměť, úložiště i chlazení podle toho, co u Vás skutečně běží.