Skip to content
AI•3 min read

What hardware do you need? GPU, VRAM and cloud

"¿Compro una GPU o alquilo?" es la pregunta equivocada. La correcta es: ¿cuántas horas al mes la voy a usar? Todo lo demás (modelo, VRAM, precio) se deriva de esa cifra y de una cuenta que puedes hacer en una servilleta.

Esta pieza tiene la cuenta, los precios reales de alquiler y la guía para decidir sin arrepentirte.

La cuenta que decide todo

VRAM necesaria ≈ pesos + caché KV + overhead

Los pesos dependen del tamaño del modelo y la precisión: un 7B en FP16 son ~14 GB; en 4 bits, ~3.5 GB. → Cuantización con números

La caché KV crece con el contexto y con las peticiones simultáneas, y es la que arruina presupuestos: un modelo que "cabe" con un usuario a 4k de contexto puede no caber con ocho a 32k. Suma un 30-50% de margen sobre los pesos cuando vayas a servir a varios usuarios.

Precios reales de GPU alquilada

Precios de lista de RunPod (Secure Cloud, por hora):

GPUVRAM$/hora
RTX A500024 GB$0.27
RTX 309024 GB$0.50
L424 GB$0.49
RTX 409024 GB$0.74
A4048 GB$0.49
L40S48 GB$1.09
A100 PCIe80 GB$1.59
H100 PCIe80 GB$2.89
H100 SXM80 GB$3.49
H200141 GB$4.59
B200180 GB$6.79
B300288 GB$7.89

Fuente: GPU Cloud Pricing - RunPod

Dos cosas que enseña la tabla: para modelos de 7B-13B cuantizados, una GPU de 24 GB sobra y cuesta menos de un dólar la hora; y pasar de 48 GB a 141 GB multiplica el precio por cuatro.

Comprar vs alquilar (con la cuenta hecha)

Supongamos una GPU de 24 GB que cuesta ~$2.000 comprarla (precio supuesto de calle) y $0.74/hora alquilarla:

2.000 $ ÷ 0.74 $/hora ≈ 2.700 horas ≈ 112 días de uso continuo

Traducción: si la usas 2 horas al día, el punto de equilibrio llega a los ~3.7 años. Si la usas todos los días, todo el día, en unos cuatro meses ya te habría salido más barato comprarla.

Regla práctica: si tu uso es intermitente, alquila; si es continuo y sostenido, comprar empieza a tener sentido (y aun así, sumar electricidad, ruido, mantenimiento y el costo de tu tiempo).

Los costos que se olvidan

  • Almacenamiento: en RunPod va de $0.07/GB/mes (red estándar) a $0.14/GB/mes (alto rendimiento); un modelo de 70 GB en disco no es gratis. - Source: GPU Cloud Pricing - RunPod
  • Tiempo encendido sin uso: la GPU factura por hora, no por token. Una instancia olvidada el fin de semana es dinero.
  • Tu tiempo: configurar drivers, CUDA y dependencias tiene costo. Si eso no es tu fuerte todavía, la nube gestionada te ahorra semanas.
  • El extremo: hay despliegues que justifican hardware caro. Servir un modelo de escala frontera a muchos usuarios no es una tarjeta: son varios nodos con GPUs interconectadas y prefill/decode desagregados. Otro mundo de presupuesto.

Qué GPU para qué modelo (orientativo)

Modelo (4 bits)PesosGPU cómoda (con margen para KV)
7B~3.5 GB12-16 GB
13B~7 GB16-24 GB
32B~16 GB24-48 GB
70B~35 GB48-80 GB

Es una guía derivada de la aritmética de arriba; el contexto y la concurrencia la mueven. Mide tu caso antes de comprar.

Cómo decidir en 5 pasos

  1. Calcula los pesos del modelo que quieres (tamaño × precisión).
  2. Suma la caché KV para tu contexto y tu concurrencia esperada (+30-50%).
  3. Mira la tabla de precios y elige el salto más chico que te alcance.
  4. Haz la cuenta de punto de equilibrio con tus horas reales al mes.
  5. Empieza alquilando. Si en dos meses la factura se parece a una compra, reconsidera.

El resto del camino está en Cuantización con números, El costo real de tu feature de AI y la guía Inference Engineering.

¿Tienes GPU propia o alquilas? Cuéntame en los comentarios qué te salió más barato, con números.

Referencias

> More posts