Unabhängiger Vergleich Aktualisiert Juli 2026 20 GPU-Anbieter getestet Echte Stundenpreise
Wir erhalten Provisionen über Partnerlinks auf dieser Seite.

Serverless GPU · Juli 2026

Beste Serverless-GPU-Cloud-Anbieter 2026

Zahle nur, wenn dein Modell läuft — keine Leerlaufkosten. 6 Serverless-GPU-Anbieter nach Kaltstart, Preis und Zuverlässigkeit sortiert.

So funktioniert Serverless GPU wirklich

Serverless-GPU-Inferenz bedeutet: Du zahlst nur, wenn dein Modell tatsächlich läuft — keine Leerlaufkosten, kein Cluster-Management. Sechs Anbieter dominieren Serverless GPU in 2026: RunPod Serverless (bester Anbieter insgesamt), Together AI (Per-Token-LLM-APIs), Salad Cloud (verteilt), Modal (entwicklerfreundlich), Nebius (Kubernetes-nativ) und CoreWeave (Enterprise-Scale).

Es gibt drei Varianten von „Serverless GPU":

  • Container-Serverless (RunPod, Modal, Nebius) — du deployst ein Docker-Image mit Handler. Kaltstarts 2–15 s für große Modelle, warme Worker können gepinnt werden.
  • Per-Token-APIs (Together AI, Anyscale) — vorgehostete Modelle mit Token-Preisen. Nie Kaltstart, aber Custom-Weights kaum möglich.
  • Verteilte Consumer-GPUs (Salad) — stateless Inferenz auf Wohn-RTX-4090. Günstigster Rohpreis, aber nicht für Training oder Stateful-Workloads.

Die richtige Wahl hängt vom Traffic-Muster ab: spitzige Low-QPS → Container-Serverless (RunPod). Konstant hohe QPS → dedizierte GPU. LLM-Inferenz at Scale → Per-Token-API (Together AI), bis du ~5.000 $/Monat überschreitest, dann selbst hosten.

AnbieterStartpreisTop-GPUsStärkenBewertungCTA
S Saladfrom $0.02/hRTX 3090, RTX 4090, RTX 3080 ≤24GB
  • Cheapest consumer GPUs — RTX 3090 from $0.09/h
  • Massive horizontal scale (1000+ nodes)
★★★★☆ 3.9Zu den Preisen
T Together AIfrom $3.99/hH100, H200, A100 80GB ≤141GB
  • Best-in-class inference performance
  • Excellent open-source model coverage
★★★★☆ 4.3Zu den Preisen
C CoreWeavefrom $6.50/hL40S, H100 SXM, A100 SXM ≤80GB
  • Best multi-node GPU cluster performance
  • High-speed InfiniBand interconnects
★★★★☆ 4.4Zu den Preisen
#1
S

Salad

Distributed inference cloud — RTX 3090 $0.09/h, RTX 4090 $0.16/h

from $0.02/h ★ 3.9
  • Cheapest consumer GPUs — RTX 3090 from $0.09/h
  • Massive horizontal scale (1000+ nodes)
Zu den Preisen →
Preis aktuell?
#2
R

RunPod

Best value GPU cloud — huge selection, community + secure cloud

from $0.16/h ★ 4.6
  • Cheapest community GPUs from $0.16/h
  • Massive GPU variety including H100
Zu den Preisen →
Preis aktuell?
#3
λ

Lambda Labs

On-demand H100 clusters — developer-favourite for serious ML

from $0.69/h ★ 4.5
  • Reliable on-demand H100 availability
  • No complex setup — SSH ready in seconds
Zu den Preisen →
Preis aktuell?
#4
N

Nebius

EU-sovereign AI cloud from the Netherlands — full GDPR compliance, H100 to B200

from $1.55/h ★ 4.5
  • Strong EU data residency — perfect for German / EU enterprise
  • Modern hardware including B200 SXM
Zu den Preisen →
Preis aktuell?
#5
T

Together AI

Inference-first GPU cloud — H100/H200 with optimized serving stacks

from $3.99/h ★ 4.3
  • Best-in-class inference performance
  • Excellent open-source model coverage
Zu den Preisen →
Preis aktuell?
#6
C

CoreWeave

Enterprise H100 clusters — Kubernetes-native GPU cloud

from $6.50/h ★ 4.4
  • Best multi-node GPU cluster performance
  • High-speed InfiniBand interconnects
Zu den Preisen →
Preis aktuell?

Häufige Fragen

Was ist eine Serverless GPU? +

Eine Serverless GPU ist ein Cloud-Compute-Modell, bei dem du pro Sekunde (oder pro Request) für GPU-Inferenz zahlst, statt eine persistente GPU-Instanz zu mieten. Der Anbieter skaliert Worker hoch, wenn Requests kommen, und auf null, wenn idle. Beste Anbieter 2026: RunPod Serverless für Container, Together AI für LLM-APIs, Salad für verteilte Inferenz.

Wie viel kostet Serverless GPU? +

RunPod Serverless berechnet pro Compute Unit — etwa $0,0002–$0,0006 pro Sekunde auf RTX 4090, oder ~$0,50/Stunde-Äquivalent während der Laufzeit. Together AI berechnet $0,10–$5 pro Million Tokens je nach Modellgröße. Salad liegt bei $0,02–$0,05/Stunde-Äquivalent auf Consumer-GPUs. Vergleich: $0,30–$2,50/Stunde für eine persistente RTX 4090/H100 — Serverless gewinnt bei Auslastung unter ~40 %.

Wie hoch ist die Kaltstart-Zeit bei Serverless GPU? +

Kaltstarts auf RunPod Serverless liegen bei 2–8 Sekunden für kleinere Modelle (7B-LLMs, SD 1.5) und 10–30 Sekunden für größere (70B-LLMs, FLUX). Du kannst warme Worker gegen Aufpreis pinnen, um Kaltstarts zu eliminieren. Per-Token-APIs (Together AI, Anyscale) haben Null Kaltstart, weil Modelle immer geladen sind.

RunPod Serverless vs. Modal vs. Together AI — welches ist am besten? +

RunPod Serverless ist am besten für Custom-Container-Inferenz zu niedrigen Kosten. Modal hat die smoothste Developer-UX (Python-Decoratoren, kein Dockerfile nötig), ist aber 2× teurer. Together AI ist am besten für Chat-/Completion-APIs mit gängigen Open-Source-Modellen. Wähle RunPod für Kosten + Flexibilität, Modal für schnelles Prototyping, Together AI für vorgehostete LLM-Inferenz.

Kann ich Training auf Serverless GPUs laufen lassen? +

Nein, Serverless-GPU-Plattformen sind für Inferenz optimiert (kurze, stateless Workloads). Für Training oder Fine-Tuning nutze persistente Instanzen: RunPod Pods, Lambda Labs On-Demand oder Vast.ai. Trainingsläufe brauchen konsistenten GPU-Speicher über Stunden/Tage — der Container-Start-Overhead von Serverless killt die Training-Ökonomie.

Hat AWS eine Serverless GPU? +

AWS Lambda unterstützt keine GPU. Amazon SageMaker Serverless Inference unterstützt nur CPU. Das nächste AWS-Äquivalent ist SageMaker Real-Time Inference mit Auto-Scaling, aber es rechnet nach Instance-Stunde ab, nicht pro Sekunde — also nicht wirklich serverless. Nutze RunPod Serverless oder Modal auf AWS-adjacenten Workloads.