Salad
Distributed inference cloud — RTX 3090 $0.09/h, RTX 4090 $0.16/h
- Cheapest consumer GPUs — RTX 3090 from $0.09/h
- Massive horizontal scale (1000+ nodes)
Serverless GPU · Juli 2026
Zahle nur, wenn dein Modell läuft — keine Leerlaufkosten. 6 Serverless-GPU-Anbieter nach Kaltstart, Preis und Zuverlässigkeit sortiert.
Serverless-GPU-Inferenz bedeutet: Du zahlst nur, wenn dein Modell tatsächlich läuft — keine Leerlaufkosten, kein Cluster-Management. Sechs Anbieter dominieren Serverless GPU in 2026: RunPod Serverless (bester Anbieter insgesamt), Together AI (Per-Token-LLM-APIs), Salad Cloud (verteilt), Modal (entwicklerfreundlich), Nebius (Kubernetes-nativ) und CoreWeave (Enterprise-Scale).
Es gibt drei Varianten von „Serverless GPU":
Die richtige Wahl hängt vom Traffic-Muster ab: spitzige Low-QPS → Container-Serverless (RunPod). Konstant hohe QPS → dedizierte GPU. LLM-Inferenz at Scale → Per-Token-API (Together AI), bis du ~5.000 $/Monat überschreitest, dann selbst hosten.
| Anbieter | Startpreis | Top-GPUs | Stärken | Bewertung | CTA |
|---|---|---|---|---|---|
| Salad | from $0.02/h | RTX 3090, RTX 4090, RTX 3080 ≤24GB |
| ★★★★☆ | Zu den Preisen |
| RunPod Editor's Choice | from $0.16/h | RTX A5000, RTX 3090, RTX 4090 ≤80GB |
| ★★★★★ | Zu den Preisen |
| Lambda Labs Editor's Choice | from $0.69/h | Quadro RTX 6000, A100 40GB, A100 80GB ≤80GB |
| ★★★★★ | Zu den Preisen |
| Nebius Editor's Choice | from $1.55/h | H100, H200, B200 ≤192GB |
| ★★★★★ | Zu den Preisen |
| Together AI | from $3.99/h | H100, H200, A100 80GB ≤141GB |
| ★★★★☆ | Zu den Preisen |
| CoreWeave | from $6.50/h | L40S, H100 SXM, A100 SXM ≤80GB |
| ★★★★☆ | Zu den Preisen |
Distributed inference cloud — RTX 3090 $0.09/h, RTX 4090 $0.16/h
Best value GPU cloud — huge selection, community + secure cloud
On-demand H100 clusters — developer-favourite for serious ML
EU-sovereign AI cloud from the Netherlands — full GDPR compliance, H100 to B200
Inference-first GPU cloud — H100/H200 with optimized serving stacks
Enterprise H100 clusters — Kubernetes-native GPU cloud
Eine Serverless GPU ist ein Cloud-Compute-Modell, bei dem du pro Sekunde (oder pro Request) für GPU-Inferenz zahlst, statt eine persistente GPU-Instanz zu mieten. Der Anbieter skaliert Worker hoch, wenn Requests kommen, und auf null, wenn idle. Beste Anbieter 2026: RunPod Serverless für Container, Together AI für LLM-APIs, Salad für verteilte Inferenz.
RunPod Serverless berechnet pro Compute Unit — etwa $0,0002–$0,0006 pro Sekunde auf RTX 4090, oder ~$0,50/Stunde-Äquivalent während der Laufzeit. Together AI berechnet $0,10–$5 pro Million Tokens je nach Modellgröße. Salad liegt bei $0,02–$0,05/Stunde-Äquivalent auf Consumer-GPUs. Vergleich: $0,30–$2,50/Stunde für eine persistente RTX 4090/H100 — Serverless gewinnt bei Auslastung unter ~40 %.
Kaltstarts auf RunPod Serverless liegen bei 2–8 Sekunden für kleinere Modelle (7B-LLMs, SD 1.5) und 10–30 Sekunden für größere (70B-LLMs, FLUX). Du kannst warme Worker gegen Aufpreis pinnen, um Kaltstarts zu eliminieren. Per-Token-APIs (Together AI, Anyscale) haben Null Kaltstart, weil Modelle immer geladen sind.
RunPod Serverless ist am besten für Custom-Container-Inferenz zu niedrigen Kosten. Modal hat die smoothste Developer-UX (Python-Decoratoren, kein Dockerfile nötig), ist aber 2× teurer. Together AI ist am besten für Chat-/Completion-APIs mit gängigen Open-Source-Modellen. Wähle RunPod für Kosten + Flexibilität, Modal für schnelles Prototyping, Together AI für vorgehostete LLM-Inferenz.
Nein, Serverless-GPU-Plattformen sind für Inferenz optimiert (kurze, stateless Workloads). Für Training oder Fine-Tuning nutze persistente Instanzen: RunPod Pods, Lambda Labs On-Demand oder Vast.ai. Trainingsläufe brauchen konsistenten GPU-Speicher über Stunden/Tage — der Container-Start-Overhead von Serverless killt die Training-Ökonomie.
AWS Lambda unterstützt keine GPU. Amazon SageMaker Serverless Inference unterstützt nur CPU. Das nächste AWS-Äquivalent ist SageMaker Real-Time Inference mit Auto-Scaling, aber es rechnet nach Instance-Stunde ab, nicht pro Sekunde — also nicht wirklich serverless. Nutze RunPod Serverless oder Modal auf AWS-adjacenten Workloads.
Wir schicken dir eine E-Mail, wenn GPU-Preise oder Verfügbarkeit sich bei deinem bevorzugten Anbieter ändern.
Kein Spam. Jederzeit abmeldbar.