Unabhängiger Vergleich Aktualisiert Juli 2026 20 GPU-Anbieter getestet Echte Stundenpreise
Wir erhalten Provisionen über Partnerlinks auf dieser Seite.

Serverless GPU · Juli 2026

Beste Serverless-GPU-Cloud-Anbieter 2026

Zahle nur, wenn dein Modell läuft — keine Leerlaufkosten. 6 Serverless-GPU-Anbieter nach Kaltstart, Preis und Zuverlässigkeit sortiert.

So funktioniert Serverless GPU wirklich

Serverless-GPU-Inferenz bedeutet: Du zahlst nur, wenn dein Modell tatsächlich läuft — keine Leerlaufkosten, kein Cluster-Management. Sechs Anbieter dominieren Serverless GPU in 2026: RunPod Serverless (bester Anbieter insgesamt), Together AI (Per-Token-LLM-APIs), Salad Cloud (verteilt), Modal (entwicklerfreundlich), Nebius (Kubernetes-nativ) und CoreWeave (Enterprise-Scale).

Es gibt drei Varianten von „Serverless GPU":

  • Container-Serverless (RunPod, Modal, Nebius) — du deployst ein Docker-Image mit Handler. Kaltstarts 2–15 s für große Modelle, warme Worker können gepinnt werden.
  • Per-Token-APIs (Together AI, Anyscale) — vorgehostete Modelle mit Token-Preisen. Nie Kaltstart, aber Custom-Weights kaum möglich.
  • Verteilte Consumer-GPUs (Salad) — stateless Inferenz auf Wohn-RTX-4090. Günstigster Rohpreis, aber nicht für Training oder Stateful-Workloads.

Die richtige Wahl hängt vom Traffic-Muster ab: spitzige Low-QPS → Container-Serverless (RunPod). Konstant hohe QPS → dedizierte GPU. LLM-Inferenz at Scale → Per-Token-API (Together AI), bis du ~5.000 $/Monat überschreitest, dann selbst hosten.

Anbieter Startpreis Top-GPUs Stärken Bewertung CTA
S Salad from $0.02/h RTX 3090, RTX 4090, RTX 3080 ≤24GB
  • Cheapest consumer GPUs — RTX 3090 from $0.09/h
  • Massive horizontal scale (1000+ nodes)
★★★★☆ 3.9 Zu den Preisen
C CoreWeave from $1.25/h L40, L40S, A100 ≤192GB
  • Best multi-node GPU cluster performance
  • High-speed InfiniBand interconnects
★★★★☆ 4.4 Zu den Preisen
T Together AI from $3.99/h H100, H200, A100 80GB ≤141GB
  • Best-in-class inference performance
  • Excellent open-source model coverage
★★★★☆ 4.3 Zu den Preisen
#1
S

Salad

Distributed inference cloud — RTX 3090 $0.09/h, RTX 4090 $0.16/h

from $0.02/h ★ 3.9
  • Cheapest consumer GPUs — RTX 3090 from $0.09/h
  • Massive horizontal scale (1000+ nodes)
Zu den Preisen →
Preis aktuell?
#2
R

RunPod

Best value GPU cloud — huge selection, community + secure cloud

from $0.16/h ★ 4.6
  • Cheapest community GPUs from $0.16/h
  • Massive GPU variety including H100
Zu den Preisen →
Preis aktuell?
#3
λ

Lambda Labs

On-demand H100 clusters — developer-favourite for serious ML

from $0.69/h ★ 4.5
  • Reliable on-demand H100 availability
  • No complex setup — SSH ready in seconds
Zu den Preisen →
Preis aktuell?
#4
C

CoreWeave

Enterprise H100 clusters — Kubernetes-native GPU cloud

from $1.25/h ★ 4.4
  • Best multi-node GPU cluster performance
  • High-speed InfiniBand interconnects
Zu den Preisen →
Preis aktuell?
#5
N

Nebius

EU-sovereign AI cloud from the Netherlands — full GDPR compliance, H100 to B200

from $1.55/h ★ 4.5
  • Strong EU data residency — perfect for German / EU enterprise
  • Modern hardware including B200 SXM
Zu den Preisen →
Preis aktuell?
#6
T

Together AI

Inference-first GPU cloud — H100/H200 with optimized serving stacks

from $3.99/h ★ 4.3
  • Best-in-class inference performance
  • Excellent open-source model coverage
Zu den Preisen →
Preis aktuell?

Häufige Fragen

Was ist eine Serverless GPU? +

Eine Serverless GPU ist ein Cloud-Compute-Modell, bei dem du pro Sekunde (oder pro Request) für GPU-Inferenz zahlst, statt eine persistente GPU-Instanz zu mieten. Der Anbieter skaliert Worker hoch, wenn Requests kommen, und auf null, wenn idle. Beste Anbieter 2026: RunPod Serverless für Container, Together AI für LLM-APIs, Salad für verteilte Inferenz.

Wie viel kostet Serverless GPU? +

RunPod Serverless berechnet pro Compute Unit — etwa $0,0002–$0,0006 pro Sekunde auf RTX 4090, oder ~$0,50/Stunde-Äquivalent während der Laufzeit. Together AI berechnet $0,10–$5 pro Million Tokens je nach Modellgröße. Salad liegt bei $0,02–$0,05/Stunde-Äquivalent auf Consumer-GPUs. Vergleich: $0,30–$2,50/Stunde für eine persistente RTX 4090/H100 — Serverless gewinnt bei Auslastung unter ~40 %.

Wie hoch ist die Kaltstart-Zeit bei Serverless GPU? +

Kaltstarts auf RunPod Serverless liegen bei 2–8 Sekunden für kleinere Modelle (7B-LLMs, SD 1.5) und 10–30 Sekunden für größere (70B-LLMs, FLUX). Du kannst warme Worker gegen Aufpreis pinnen, um Kaltstarts zu eliminieren. Per-Token-APIs (Together AI, Anyscale) haben Null Kaltstart, weil Modelle immer geladen sind.

RunPod Serverless vs. Modal vs. Together AI — welches ist am besten? +

RunPod Serverless ist am besten für Custom-Container-Inferenz zu niedrigen Kosten. Modal hat die ausgereifteste Entwicklerumgebung (Python-Dekoratoren, kein Dockerfile nötig), kostet pro GPU-Stunde aber rund doppelt so viel: 3,95 $/h für eine H100 gegenüber 1,99 $/h in RunPods Community Cloud und 2,50 $/h statt 1,19 $/h bei einer A100 80 GB. Together AI ist am besten für Chat-/Completion-APIs mit gängigen Open-Source-Modellen. Wähle RunPod für Kosten + Flexibilität, Modal für schnelles Prototyping, Together AI für vorgehostete LLM-Inferenz.

Was kostet Modal pro Stunde? +

Modal rechnet sekundengenau ab, ohne Mindestinstanzgröße: H100 für 0,001097 $/s (3,95 $/h), A100 80 GB für 0,000694 $/s (2,50 $/h), L40S für 0,000542 $/s (1,95 $/h), L4 für 0,000222 $/s (0,80 $/h) und T4 für 0,000164 $/s (0,59 $/h). CPU (0,0000131 $ je Kernsekunde, mindestens 0,125 Kerne) und Arbeitsspeicher (0,00000222 $ je GiB-Sekunde) werden zusätzlich zum GPU-Tarif berechnet, die Rechnung liegt also immer über dem reinen GPU-Preis. Der Starter-Tarif ist grundgebührenfrei und enthält 30 $ Guthaben pro Monat, Team kostet 250 $/Monat mit 100 $ Guthaben. Geprüft auf modal.com/pricing am 29. Juli 2026.

Kann ich Training auf Serverless GPUs laufen lassen? +

Nein, Serverless-GPU-Plattformen sind für Inferenz optimiert (kurze, stateless Workloads). Für Training oder Fine-Tuning nutze persistente Instanzen: RunPod Pods, Lambda Labs On-Demand oder Vast.ai. Trainingsläufe brauchen konsistenten GPU-Speicher über Stunden/Tage — der Container-Start-Overhead von Serverless killt die Training-Ökonomie.

Hat AWS eine Serverless GPU? +

AWS Lambda unterstützt keine GPU. Amazon SageMaker Serverless Inference unterstützt nur CPU. Das nächste AWS-Äquivalent ist SageMaker Real-Time Inference mit Auto-Scaling, aber es rechnet nach Instance-Stunde ab, nicht pro Sekunde — also nicht wirklich serverless. Nutze RunPod Serverless oder Modal auf AWS-adjacenten Workloads.