Comparaison indépendante Mis à jour juillet 2026 20 fournisseurs GPU testés Vrais tarifs horaires
Nous percevons des commissions sur les liens partenaires de cette page.

GPU Serverless · juillet 2026

Meilleurs fournisseurs cloud GPU serverless 2026

Payez uniquement quand votre modèle tourne — pas de facture idle. 6 fournisseurs GPU serverless classés par démarrage à froid, prix et fiabilité.

Comment fonctionne vraiment le GPU serverless

Le GPU serverless signifie que vous payez uniquement quand votre modèle tourne — pas de facture pour temps mort, pas de gestion de cluster. Six fournisseurs dominent le GPU serverless en 2026 : RunPod Serverless (meilleur global), Together AI (APIs LLM par token), Salad Cloud (distribué), Modal (developer-friendly), Nebius (Kubernetes natif) et CoreWeave (échelle enterprise).

Il existe trois variantes de « GPU serverless » :

  • Container serverless (RunPod, Modal, Nebius) — vous déployez une image Docker avec un handler. Démarrages à froid 2–15 s pour les grands modèles, workers chauds peuvent être épinglés.
  • APIs par token (Together AI, Anyscale) — modèles pré-hébergés avec tarification au token. Jamais de démarrage à froid, mais impossible d'utiliser des poids customs facilement.
  • GPUs consumer distribués (Salad) — inférence stateless sur des RTX 4090 résidentielles. Prix brut le plus bas mais pas pour training ni workloads stateful.

Le bon choix dépend du pattern de trafic : pics à faible QPS → container serverless (RunPod). QPS constant et élevé → GPU dédié. Inférence LLM à grande échelle → API par token (Together AI) jusqu'à ~5 000 $/mois, puis self-hosting.

ProviderStarting PriceTop GPUsHighlightsRatingCTA
S Saladfrom $0.02/hRTX 3090, RTX 4090, RTX 3080 ≤24GB
  • Cheapest consumer GPUs — RTX 3090 from $0.09/h
  • Massive horizontal scale (1000+ nodes)
★★★★☆ 3.9View pricing
T Together AIfrom $3.99/hH100, H200, A100 80GB ≤141GB
  • Best-in-class inference performance
  • Excellent open-source model coverage
★★★★☆ 4.3View pricing
C CoreWeavefrom $6.50/hL40S, H100 SXM, A100 SXM ≤80GB
  • Best multi-node GPU cluster performance
  • High-speed InfiniBand interconnects
★★★★☆ 4.4View pricing
#1
S

Salad

Distributed inference cloud — RTX 3090 $0.09/h, RTX 4090 $0.16/h

from $0.02/h ★ 3.9
  • Cheapest consumer GPUs — RTX 3090 from $0.09/h
  • Massive horizontal scale (1000+ nodes)
View pricing →
Price accurate?
#2
R

RunPod

Best value GPU cloud — huge selection, community + secure cloud

from $0.16/h ★ 4.6
  • Cheapest community GPUs from $0.16/h
  • Massive GPU variety including H100
View pricing →
Price accurate?
#3
λ

Lambda Labs

On-demand H100 clusters — developer-favourite for serious ML

from $0.69/h ★ 4.5
  • Reliable on-demand H100 availability
  • No complex setup — SSH ready in seconds
View pricing →
Price accurate?
#4
N

Nebius

EU-sovereign AI cloud from the Netherlands — full GDPR compliance, H100 to B200

from $1.55/h ★ 4.5
  • Strong EU data residency — perfect for German / EU enterprise
  • Modern hardware including B200 SXM
View pricing →
Price accurate?
#5
T

Together AI

Inference-first GPU cloud — H100/H200 with optimized serving stacks

from $3.99/h ★ 4.3
  • Best-in-class inference performance
  • Excellent open-source model coverage
View pricing →
Price accurate?
#6
C

CoreWeave

Enterprise H100 clusters — Kubernetes-native GPU cloud

from $6.50/h ★ 4.4
  • Best multi-node GPU cluster performance
  • High-speed InfiniBand interconnects
View pricing →
Price accurate?

Frequently Asked Questions

Qu'est-ce qu'un GPU serverless ? +

Un GPU serverless est un modèle de calcul cloud où vous payez à la seconde (ou à la requête) pour l'inférence GPU au lieu de louer une instance GPU persistante. Le fournisseur monte des workers automatiquement à l'arrivée de requêtes et redescend à zéro en cas d'inactivité. Meilleurs fournisseurs en 2026 : RunPod Serverless pour les containers, Together AI pour les APIs LLM, Salad pour l'inférence distribuée.

Combien coûte un GPU serverless ? +

RunPod Serverless facture à l'unité de calcul — environ $0,0002–$0,0006 par seconde sur RTX 4090, soit ~$0,50/heure équivalent en exécution. Together AI facture $0,10–$5 par million de tokens selon la taille du modèle. Salad tourne autour de $0,02–$0,05/heure équivalent sur GPUs consumer. Comparé à $0,30–$2,50/heure pour une RTX 4090/H100 persistante — le serverless gagne quand votre utilisation est inférieure à ~40 %.

Quel est le temps de démarrage à froid pour un GPU serverless ? +

Les démarrages à froid sur RunPod Serverless sont de 2–8 secondes pour les petits modèles (LLM 7B, SD 1.5) et 10–30 secondes pour les grands (LLM 70B, FLUX). Vous pouvez épingler des workers chauds moyennant supplément pour éliminer les démarrages à froid. Les APIs par token (Together AI, Anyscale) ont zéro démarrage à froid car les modèles sont toujours chargés.

RunPod Serverless vs Modal vs Together AI — lequel est meilleur ? +

RunPod Serverless est meilleur pour l'inférence container custom à bas coût. Modal a l'UX developer la plus fluide (décorateurs Python, pas de Dockerfile requis) mais est 2× plus cher. Together AI est meilleur pour les APIs chat/completion avec les modèles open-source populaires. Choisissez RunPod pour coût + flexibilité, Modal pour prototypage rapide, Together AI pour inférence LLM pré-hébergée.

Puis-je faire du training sur GPUs serverless ? +

Non, les plateformes GPU serverless sont optimisées pour l'inférence (workloads courts, stateless). Pour training ou fine-tuning, utilisez des instances persistantes : RunPod Pods, Lambda Labs on-demand, ou Vast.ai. Les runs d'entraînement nécessitent une mémoire GPU consistante sur des heures/jours — l'overhead de démarrage du serverless tue l'économie du training.

AWS propose-t-il du GPU serverless ? +

AWS Lambda ne supporte pas les GPU. Amazon SageMaker Serverless Inference supporte uniquement CPU. L'équivalent AWS le plus proche est SageMaker Real-Time Inference avec auto-scaling, mais il facture à l'heure d'instance, pas à la seconde — donc pas vraiment serverless. Utilisez RunPod Serverless ou Modal pour les workloads AWS-adjacents.