¿Qué hardware necesitas? GPU, VRAM y cloud
"¿Compro una GPU o alquilo?" es la pregunta equivocada. La correcta es: ¿cuántas horas al mes la voy a usar? Todo lo demás (modelo, VRAM, precio) se deriva de esa cifra y de una cuenta que puedes hacer en una servilleta.
Esta pieza tiene la cuenta, los precios reales de alquiler y la guía para decidir sin arrepentirte.
La cuenta que decide todo
VRAM necesaria ≈ pesos + caché KV + overhead
Los pesos dependen del tamaño del modelo y la precisión: un 7B en FP16 son ~14 GB; en 4 bits, ~3.5 GB. → Cuantización con números
La caché KV crece con el contexto y con las peticiones simultáneas, y es la que arruina presupuestos: un modelo que "cabe" con un usuario a 4k de contexto puede no caber con ocho a 32k. Suma un 30-50% de margen sobre los pesos cuando vayas a servir a varios usuarios.
Precios reales de GPU alquilada
Precios de lista de RunPod (Secure Cloud, por hora):
| GPU | VRAM | $/hora |
|---|---|---|
| RTX A5000 | 24 GB | $0.27 |
| RTX 3090 | 24 GB | $0.50 |
| L4 | 24 GB | $0.49 |
| RTX 4090 | 24 GB | $0.74 |
| A40 | 48 GB | $0.49 |
| L40S | 48 GB | $1.09 |
| A100 PCIe | 80 GB | $1.59 |
| H100 PCIe | 80 GB | $2.89 |
| H100 SXM | 80 GB | $3.49 |
| H200 | 141 GB | $4.59 |
| B200 | 180 GB | $6.79 |
| B300 | 288 GB | $7.89 |
Fuente: GPU Cloud Pricing - RunPod
Dos cosas que enseña la tabla: para modelos de 7B-13B cuantizados, una GPU de 24 GB sobra y cuesta menos de un dólar la hora; y pasar de 48 GB a 141 GB multiplica el precio por cuatro.
Comprar vs alquilar (con la cuenta hecha)
Supongamos una GPU de 24 GB que cuesta ~$2.000 comprarla (precio supuesto de calle) y $0.74/hora alquilarla:
2.000 $ ÷ 0.74 $/hora ≈ 2.700 horas ≈ 112 días de uso continuo
Traducción: si la usas 2 horas al día, el punto de equilibrio llega a los ~3.7 años. Si la usas todos los días, todo el día, en unos cuatro meses ya te habría salido más barato comprarla.
Regla práctica: si tu uso es intermitente, alquila; si es continuo y sostenido, comprar empieza a tener sentido (y aun así, sumar electricidad, ruido, mantenimiento y el costo de tu tiempo).
Los costos que se olvidan
- Almacenamiento: en RunPod va de $0.07/GB/mes (red estándar) a $0.14/GB/mes (alto rendimiento); un modelo de 70 GB en disco no es gratis. - Source: GPU Cloud Pricing - RunPod
- Tiempo encendido sin uso: la GPU factura por hora, no por token. Una instancia olvidada el fin de semana es dinero.
- Tu tiempo: configurar drivers, CUDA y dependencias tiene costo. Si eso no es tu fuerte todavía, la nube gestionada te ahorra semanas.
- El extremo: hay despliegues que justifican hardware caro. Servir un modelo de escala frontera a muchos usuarios no es una tarjeta: son varios nodos con GPUs interconectadas y prefill/decode desagregados. Otro mundo de presupuesto.
Qué GPU para qué modelo (orientativo)
| Modelo (4 bits) | Pesos | GPU cómoda (con margen para KV) |
|---|---|---|
| 7B | ~3.5 GB | 12-16 GB |
| 13B | ~7 GB | 16-24 GB |
| 32B | ~16 GB | 24-48 GB |
| 70B | ~35 GB | 48-80 GB |
Es una guía derivada de la aritmética de arriba; el contexto y la concurrencia la mueven. Mide tu caso antes de comprar.
Cómo decidir en 5 pasos
- Calcula los pesos del modelo que quieres (tamaño × precisión).
- Suma la caché KV para tu contexto y tu concurrencia esperada (+30-50%).
- Mira la tabla de precios y elige el salto más chico que te alcance.
- Haz la cuenta de punto de equilibrio con tus horas reales al mes.
- Empieza alquilando. Si en dos meses la factura se parece a una compra, reconsidera.
El resto del camino está en Cuantización con números, El costo real de tu feature de AI y la guía Inference Engineering.
¿Tienes GPU propia o alquilas? Cuéntame en los comentarios qué te salió más barato, con números.