Comparativa independiente Actualizado julio 2026 20 proveedores GPU probados Precios horarios reales
Ganamos comisiones por enlaces de socios en esta página.

GPU Serverless · julio 2026

Mejores proveedores cloud GPU serverless 2026

Paga solo cuando tu modelo se ejecute — sin facturas idle. 6 proveedores GPU serverless clasificados por arranque en frío, precio y fiabilidad.

Cómo funciona realmente el GPU serverless

Inferencia GPU serverless significa que solo pagas cuando tu modelo realmente se ejecuta — sin facturas de tiempo inactivo, sin gestión de clúster. Seis proveedores dominan GPU serverless en 2026: RunPod Serverless (mejor en general), Together AI (APIs LLM por token), Salad Cloud (distribuido), Modal (developer-friendly), Nebius (Kubernetes nativo) y CoreWeave (escala enterprise).

Hay tres sabores de "GPU serverless":

  • Container serverless (RunPod, Modal, Nebius) — despliegas una imagen Docker con un handler. Arranques en frío 2–15 s para modelos grandes, workers calientes se pueden anclar.
  • APIs por token (Together AI, Anyscale) — modelos pre-alojados con precio por token. Nunca arranque en frío, pero no puedes ejecutar pesos custom fácilmente.
  • GPUs consumer distribuidas (Salad) — inferencia stateless en RTX 4090 residenciales. Precio bruto más bajo pero no para training ni cargas stateful.

La elección correcta depende del patrón de tráfico: picos con QPS bajo → container serverless (RunPod). QPS constante alto → GPU dedicada. Inferencia LLM a escala → API por token (Together AI) hasta que superes ~5.000 $/mes, luego auto-alojar.

ProviderStarting PriceTop GPUsHighlightsRatingCTA
S Saladfrom $0.02/hRTX 3090, RTX 4090, RTX 3080 ≤24GB
  • Cheapest consumer GPUs — RTX 3090 from $0.09/h
  • Massive horizontal scale (1000+ nodes)
★★★★☆ 3.9View pricing
T Together AIfrom $3.99/hH100, H200, A100 80GB ≤141GB
  • Best-in-class inference performance
  • Excellent open-source model coverage
★★★★☆ 4.3View pricing
C CoreWeavefrom $6.50/hL40S, H100 SXM, A100 SXM ≤80GB
  • Best multi-node GPU cluster performance
  • High-speed InfiniBand interconnects
★★★★☆ 4.4View pricing
#1
S

Salad

Distributed inference cloud — RTX 3090 $0.09/h, RTX 4090 $0.16/h

from $0.02/h ★ 3.9
  • Cheapest consumer GPUs — RTX 3090 from $0.09/h
  • Massive horizontal scale (1000+ nodes)
View pricing →
Price accurate?
#2
R

RunPod

Best value GPU cloud — huge selection, community + secure cloud

from $0.16/h ★ 4.6
  • Cheapest community GPUs from $0.16/h
  • Massive GPU variety including H100
View pricing →
Price accurate?
#3
λ

Lambda Labs

On-demand H100 clusters — developer-favourite for serious ML

from $0.69/h ★ 4.5
  • Reliable on-demand H100 availability
  • No complex setup — SSH ready in seconds
View pricing →
Price accurate?
#4
N

Nebius

EU-sovereign AI cloud from the Netherlands — full GDPR compliance, H100 to B200

from $1.55/h ★ 4.5
  • Strong EU data residency — perfect for German / EU enterprise
  • Modern hardware including B200 SXM
View pricing →
Price accurate?
#5
T

Together AI

Inference-first GPU cloud — H100/H200 with optimized serving stacks

from $3.99/h ★ 4.3
  • Best-in-class inference performance
  • Excellent open-source model coverage
View pricing →
Price accurate?
#6
C

CoreWeave

Enterprise H100 clusters — Kubernetes-native GPU cloud

from $6.50/h ★ 4.4
  • Best multi-node GPU cluster performance
  • High-speed InfiniBand interconnects
View pricing →
Price accurate?

Frequently Asked Questions

¿Qué es un GPU serverless? +

Un GPU serverless es un modelo de computación cloud donde pagas por segundo (o por petición) por inferencia GPU en lugar de alquilar una instancia GPU persistente. El proveedor auto-escala workers al llegar peticiones y baja a cero cuando está inactivo. Mejores proveedores en 2026: RunPod Serverless para contenedores, Together AI para APIs LLM, Salad para inferencia distribuida.

¿Cuánto cuesta un GPU serverless? +

RunPod Serverless cobra por unidad de cómputo — aprox. $0,0002–$0,0006 por segundo en RTX 4090, o ~$0,50/hora equivalente en ejecución. Together AI cobra $0,10–$5 por millón de tokens según el tamaño del modelo. Salad ronda $0,02–$0,05/hora equivalente en GPUs consumer. Comparado con $0,30–$2,50/hora para una RTX 4090/H100 persistente — el serverless gana cuando tu utilización es inferior al ~40 %.

¿Cuál es el tiempo de arranque en frío para GPU serverless? +

Los arranques en frío en RunPod Serverless son de 2–8 segundos para modelos pequeños (LLM 7B, SD 1.5) y 10–30 segundos para los grandes (LLM 70B, FLUX). Puedes anclar workers calientes con coste extra para eliminar arranques en frío. Las APIs por token (Together AI, Anyscale) tienen cero arranque en frío porque los modelos siempre están cargados.

RunPod Serverless vs Modal vs Together AI — ¿cuál es mejor? +

RunPod Serverless es mejor para inferencia container custom a bajo coste. Modal tiene la UX developer más fluida (decoradores Python, sin Dockerfile requerido) pero es 2× más caro. Together AI es mejor para APIs chat/completion con modelos open-source populares. Elige RunPod para coste + flexibilidad, Modal para prototipado rápido, Together AI para inferencia LLM pre-alojada.

¿Puedo entrenar en GPUs serverless? +

No, las plataformas GPU serverless están optimizadas para inferencia (cargas cortas, stateless). Para entrenamiento o fine-tuning, usa instancias persistentes: RunPod Pods, Lambda Labs on-demand, o Vast.ai. Las ejecuciones de entrenamiento necesitan memoria GPU consistente durante horas/días — la sobrecarga de arranque del serverless mata la economía del entrenamiento.

¿AWS tiene GPU serverless? +

AWS Lambda no soporta GPU. Amazon SageMaker Serverless Inference solo soporta CPU. El equivalente AWS más cercano es SageMaker Real-Time Inference con auto-scaling, pero factura por hora de instancia, no por segundo — así que no es realmente serverless. Usa RunPod Serverless o Modal en cargas adyacentes a AWS.