Salad
Distributed inference cloud — RTX 3090 $0.09/h, RTX 4090 $0.16/h
- Cheapest consumer GPUs — RTX 3090 from $0.09/h
- Massive horizontal scale (1000+ nodes)
GPU Serverless · julio 2026
Paga solo cuando tu modelo se ejecute — sin facturas idle. 6 proveedores GPU serverless clasificados por arranque en frío, precio y fiabilidad.
Inferencia GPU serverless significa que solo pagas cuando tu modelo realmente se ejecuta — sin facturas de tiempo inactivo, sin gestión de clúster. Seis proveedores dominan GPU serverless en 2026: RunPod Serverless (mejor en general), Together AI (APIs LLM por token), Salad Cloud (distribuido), Modal (developer-friendly), Nebius (Kubernetes nativo) y CoreWeave (escala enterprise).
Hay tres sabores de "GPU serverless":
La elección correcta depende del patrón de tráfico: picos con QPS bajo → container serverless (RunPod). QPS constante alto → GPU dedicada. Inferencia LLM a escala → API por token (Together AI) hasta que superes ~5.000 $/mes, luego auto-alojar.
| Provider | Starting Price | Top GPUs | Highlights | Rating | CTA |
|---|---|---|---|---|---|
| Salad | from $0.02/h | RTX 3090, RTX 4090, RTX 3080 ≤24GB |
| ★★★★☆ | View pricing |
| RunPod Editor's Choice | from $0.16/h | RTX A5000, RTX 3090, RTX 4090 ≤80GB |
| ★★★★★ | View pricing |
| Lambda Labs Editor's Choice | from $0.69/h | Quadro RTX 6000, A100 40GB, A100 80GB ≤80GB |
| ★★★★★ | View pricing |
| Nebius Editor's Choice | from $1.55/h | H100, H200, B200 ≤192GB |
| ★★★★★ | View pricing |
| Together AI | from $3.99/h | H100, H200, A100 80GB ≤141GB |
| ★★★★☆ | View pricing |
| CoreWeave | from $6.50/h | L40S, H100 SXM, A100 SXM ≤80GB |
| ★★★★☆ | View pricing |
Distributed inference cloud — RTX 3090 $0.09/h, RTX 4090 $0.16/h
Best value GPU cloud — huge selection, community + secure cloud
On-demand H100 clusters — developer-favourite for serious ML
EU-sovereign AI cloud from the Netherlands — full GDPR compliance, H100 to B200
Inference-first GPU cloud — H100/H200 with optimized serving stacks
Enterprise H100 clusters — Kubernetes-native GPU cloud
Un GPU serverless es un modelo de computación cloud donde pagas por segundo (o por petición) por inferencia GPU en lugar de alquilar una instancia GPU persistente. El proveedor auto-escala workers al llegar peticiones y baja a cero cuando está inactivo. Mejores proveedores en 2026: RunPod Serverless para contenedores, Together AI para APIs LLM, Salad para inferencia distribuida.
RunPod Serverless cobra por unidad de cómputo — aprox. $0,0002–$0,0006 por segundo en RTX 4090, o ~$0,50/hora equivalente en ejecución. Together AI cobra $0,10–$5 por millón de tokens según el tamaño del modelo. Salad ronda $0,02–$0,05/hora equivalente en GPUs consumer. Comparado con $0,30–$2,50/hora para una RTX 4090/H100 persistente — el serverless gana cuando tu utilización es inferior al ~40 %.
Los arranques en frío en RunPod Serverless son de 2–8 segundos para modelos pequeños (LLM 7B, SD 1.5) y 10–30 segundos para los grandes (LLM 70B, FLUX). Puedes anclar workers calientes con coste extra para eliminar arranques en frío. Las APIs por token (Together AI, Anyscale) tienen cero arranque en frío porque los modelos siempre están cargados.
RunPod Serverless es mejor para inferencia container custom a bajo coste. Modal tiene la UX developer más fluida (decoradores Python, sin Dockerfile requerido) pero es 2× más caro. Together AI es mejor para APIs chat/completion con modelos open-source populares. Elige RunPod para coste + flexibilidad, Modal para prototipado rápido, Together AI para inferencia LLM pre-alojada.
No, las plataformas GPU serverless están optimizadas para inferencia (cargas cortas, stateless). Para entrenamiento o fine-tuning, usa instancias persistentes: RunPod Pods, Lambda Labs on-demand, o Vast.ai. Las ejecuciones de entrenamiento necesitan memoria GPU consistente durante horas/días — la sobrecarga de arranque del serverless mata la economía del entrenamiento.
AWS Lambda no soporta GPU. Amazon SageMaker Serverless Inference solo soporta CPU. El equivalente AWS más cercano es SageMaker Real-Time Inference con auto-scaling, pero factura por hora de instancia, no por segundo — así que no es realmente serverless. Usa RunPod Serverless o Modal en cargas adyacentes a AWS.
Get an email when GPU prices drop or availability changes at your preferred provider.
No spam. Unsubscribe any time.