NVIDIA L4. 24 GB Inferenz-GPU mit 72 Watt
NVIDIA L4 mieten: 24 GB GDDR6, Tensor-Kerne der 4. Generation mit FP8 und eigene AV1-Video-Engines in einer Rechenzentrums-GPU mit 72 W. Gemacht für LLM-Serving, Bildgenerierung, Computer Vision und Video-Transcoding. In Minuten einsatzbereit aus deutschen Rechenzentren.
Warum die NVIDIA L4
24 GB VRAM
Mehr Speicher als die RTX 4000 Ada. Platz für 7B-8B LLMs in FP16, 13B-14B Modelle in FP8 und größere KV-Caches für mehr gleichzeitige Nutzer.
Gebaut für Inferenz
Tensor-Kerne der 4. Generation mit FP8, BF16 und Sparsity. vLLM, TensorRT-LLM, Triton, ComfyUI und alle gängigen KI-Frameworks.
AV1-Video-Engines
2 NVENC- und 4 NVDEC-Einheiten mit AV1-Support. Viele Videostreams parallel transkodieren, analysieren und ausliefern.
Effizient mit 72 W
Rechenzentrums-GPU für Inferenz rund um die Uhr, mit einem Bruchteil der Leistungsaufnahme großer Trainings-GPUs.
Dediziert statt geteilt
Die ganze GPU gehört Ihnen. Kein Time-Slicing, keine lauten Nachbarn, planbare Latenz.
Gehostet in Deutschland
DSGVO-konforme Rechenzentren, niedrige EU-Latenz, kein US-Cloud-Lock-in.
Was enthalten ist
- 1× NVIDIA L4 (24 GB GDDR6)
- AMD-EPYC-vCPU-Kerne und RAM
- Schneller NVMe-SSD-Speicher
- 1× IPv4 + /64 IPv6
- Großzügiger Traffic, keine Übernutzungsgebühren
- Voller Root-Zugriff, eigene KI-Stacks frei wählbar
- Snapshots und Backups verfügbar
NVIDIA L4 Specs
NVIDIA L4 mieten
NVIDIA-L4-Tarife ab 179,99 € / Monat. Längere Laufzeiten bringen zusätzliche Rabatte.
Häufige Fragen
Wofür eignet sich die NVIDIA L4 am besten?+
Für das Serving von LLMs und Embedding-Modellen, Bildgenerierung mit Stable Diffusion, Computer Vision, Spracherkennung und Video-Workloads wie Transcoding und Videoanalyse. Sie ist für Inferenz ausgelegt, die rund um die Uhr läuft.
Welche LLMs passen in 24 GB?+
7B-8B Modelle wie Llama 3 8B oder Mistral 7B laufen in FP16 mit Platz für den KV-Cache. 13B-14B Modelle passen in FP8 oder INT8, mit 4-Bit-Quantisierung sind sogar Modelle um 30B Parameter möglich.
Wie schneidet sie im Vergleich zur RTX 4000 Ada ab?+
Beide nutzen die Ada-Lovelace-Architektur. Die L4 hat 24 statt 20 GB VRAM, eigene AV1-Video-Engines und ein 72-W-Rechenzentrumsdesign. Die RTX 4000 Ada hat mehr Speicherbandbreite und ist die bessere Wahl fürs Rendering. Für Inferenz mit größeren Modellen oder Video nehmen Sie die L4.
Kann ich damit trainieren?+
Fine-Tuning kleinerer Modelle mit LoRA oder QLoRA ja. Für das Training größerer Modelle ist die RTX 6000 Ada mit 48 GB VRAM die bessere Wahl.