Salad
Distributed inference cloud — RTX 3090 $0.09/h, RTX 4090 $0.16/h
- Cheapest consumer GPUs — RTX 3090 from $0.09/h
- Massive horizontal scale (1000+ nodes)
GPU Serverless · juillet 2026
Payez uniquement quand votre modèle tourne — pas de facture idle. 6 fournisseurs GPU serverless classés par démarrage à froid, prix et fiabilité.
Le GPU serverless signifie que vous payez uniquement quand votre modèle tourne — pas de facture pour temps mort, pas de gestion de cluster. Six fournisseurs dominent le GPU serverless en 2026 : RunPod Serverless (meilleur global), Together AI (APIs LLM par token), Salad Cloud (distribué), Modal (developer-friendly), Nebius (Kubernetes natif) et CoreWeave (échelle enterprise).
Il existe trois variantes de « GPU serverless » :
Le bon choix dépend du pattern de trafic : pics à faible QPS → container serverless (RunPod). QPS constant et élevé → GPU dédié. Inférence LLM à grande échelle → API par token (Together AI) jusqu'à ~5 000 $/mois, puis self-hosting.
| Provider | Starting Price | Top GPUs | Highlights | Rating | CTA |
|---|---|---|---|---|---|
| Salad | from $0.02/h | RTX 3090, RTX 4090, RTX 3080 ≤24GB |
| ★★★★☆ | View pricing |
| RunPod Editor's Choice | from $0.16/h | RTX A5000, RTX 3090, RTX 4090 ≤80GB |
| ★★★★★ | View pricing |
| Lambda Labs Editor's Choice | from $0.69/h | Quadro RTX 6000, A100 40GB, A100 80GB ≤80GB |
| ★★★★★ | View pricing |
| Nebius Editor's Choice | from $1.55/h | H100, H200, B200 ≤192GB |
| ★★★★★ | View pricing |
| Together AI | from $3.99/h | H100, H200, A100 80GB ≤141GB |
| ★★★★☆ | View pricing |
| CoreWeave | from $6.50/h | L40S, H100 SXM, A100 SXM ≤80GB |
| ★★★★☆ | View pricing |
Distributed inference cloud — RTX 3090 $0.09/h, RTX 4090 $0.16/h
Best value GPU cloud — huge selection, community + secure cloud
On-demand H100 clusters — developer-favourite for serious ML
EU-sovereign AI cloud from the Netherlands — full GDPR compliance, H100 to B200
Inference-first GPU cloud — H100/H200 with optimized serving stacks
Enterprise H100 clusters — Kubernetes-native GPU cloud
Un GPU serverless est un modèle de calcul cloud où vous payez à la seconde (ou à la requête) pour l'inférence GPU au lieu de louer une instance GPU persistante. Le fournisseur monte des workers automatiquement à l'arrivée de requêtes et redescend à zéro en cas d'inactivité. Meilleurs fournisseurs en 2026 : RunPod Serverless pour les containers, Together AI pour les APIs LLM, Salad pour l'inférence distribuée.
RunPod Serverless facture à l'unité de calcul — environ $0,0002–$0,0006 par seconde sur RTX 4090, soit ~$0,50/heure équivalent en exécution. Together AI facture $0,10–$5 par million de tokens selon la taille du modèle. Salad tourne autour de $0,02–$0,05/heure équivalent sur GPUs consumer. Comparé à $0,30–$2,50/heure pour une RTX 4090/H100 persistante — le serverless gagne quand votre utilisation est inférieure à ~40 %.
Les démarrages à froid sur RunPod Serverless sont de 2–8 secondes pour les petits modèles (LLM 7B, SD 1.5) et 10–30 secondes pour les grands (LLM 70B, FLUX). Vous pouvez épingler des workers chauds moyennant supplément pour éliminer les démarrages à froid. Les APIs par token (Together AI, Anyscale) ont zéro démarrage à froid car les modèles sont toujours chargés.
RunPod Serverless est meilleur pour l'inférence container custom à bas coût. Modal a l'UX developer la plus fluide (décorateurs Python, pas de Dockerfile requis) mais est 2× plus cher. Together AI est meilleur pour les APIs chat/completion avec les modèles open-source populaires. Choisissez RunPod pour coût + flexibilité, Modal pour prototypage rapide, Together AI pour inférence LLM pré-hébergée.
Non, les plateformes GPU serverless sont optimisées pour l'inférence (workloads courts, stateless). Pour training ou fine-tuning, utilisez des instances persistantes : RunPod Pods, Lambda Labs on-demand, ou Vast.ai. Les runs d'entraînement nécessitent une mémoire GPU consistante sur des heures/jours — l'overhead de démarrage du serverless tue l'économie du training.
AWS Lambda ne supporte pas les GPU. Amazon SageMaker Serverless Inference supporte uniquement CPU. L'équivalent AWS le plus proche est SageMaker Real-Time Inference avec auto-scaling, mais il facture à l'heure d'instance, pas à la seconde — donc pas vraiment serverless. Utilisez RunPod Serverless ou Modal pour les workloads AWS-adjacents.
Get an email when GPU prices drop or availability changes at your preferred provider.
No spam. Unsubscribe any time.