Cuantización, inferencia y costo de GPU al desplegar un LLM

01/10/2026

Cuantización, inferencia y costo de GPU al desplegar un LLM

El modelo corre de maravilla en la computadora del ingeniero. Luego pasa a producción, va lentísimo y la factura de GPU de fin de mes hace que en finanzas se agarren la cabeza. He visto repetirse este guion en muchos equipos que desarrollan un LLM en vietnamita. La raíz suele estar en tres conceptos que pocos explican bien: la cuantización (quantization), la inferencia y la forma en que se cobran las GPU. Voy a intentar describirlos para alguien que no está metido a fondo en lo técnico.

Qué es la inferencia y por qué se vuelve el costo de largo plazo

El entrenamiento es cuando el modelo aprende. La inferencia es cuando trabaja: recibe una pregunta y genera una respuesta. El entrenamiento es caro, pero ocurre una vez, o unas cuantas. La inferencia ocurre cada vez que llega un usuario, todos los días, a todas horas. En un producto con usuarios reales, el gasto total de inferencia con frecuencia rebasa al de entrenamiento después de un tiempo suficiente.

Un punto que se malinterpreta mucho: el modelo genera texto un token a la vez. Cada token nuevo requiere leer casi todos los pesos del modelo desde la memoria de la GPU. Por eso la velocidad de respuesta está limitada más por el ancho de banda de memoria que por la capacidad de cómputo pura. Al entender esto queda claro por qué reducir el tamaño del modelo ayuda a que corra más rápido.

Cuantización: comprimir un modelo como se comprime una foto

Los pesos de un modelo son miles de millones de números. Por defecto, cada uno se guarda con alta precisión y ocupa 16 bits. La cuantización los guarda con menos bits, normalmente 8 o 4. Es como comprimir una fotografía: el archivo se hace mucho más chico, a simple vista casi se ve igual, pero si le hacen zoom notarán algunos detalles borrosos.

Los beneficios son muy prácticos. El modelo ocupa menos memoria, así que cabe en GPU más baratas o en menos GPU. Los pesos se leen más rápido, por lo que la velocidad de generación normalmente mejora. El precio es que la calidad puede bajar, y cuánto depende del modelo, del método de compresión y de la tarea. En respuestas simples, la diferencia a veces es insignificante. En razonamiento de varios pasos, cálculos o textos especializados con términos poco frecuentes, noto que la calidad se afecta con más facilidad.

No existe un número mágico que sirva para todos los casos. La única forma confiable es correr la versión comprimida con sus propias preguntas reales y compararla con la original. En vietnamita, revisen por separado los casos con diacríticos complicados, nombres propios y cifras, porque ahí es donde suelen aparecer los errores.

Cómo se arma el costo de GPU

Sin entrar en detalles, el costo de operar un servicio de LLM tiene varias partes:

  • Hardware: comprar o rentar GPU. La cantidad de memoria define qué modelos caben.
  • Tiempo de ejecución: las GPU rentadas se cobran por hora, así que dejarlas encendidas todo el día cuesta aunque solo un par de personas pregunte algo a medianoche.
  • Aprovechamiento: una GPU que trabaja al 10% significa que el otro 90% es dinero quemado.
  • Personal: quienes monitorean, ajustan y atienden incidentes, algo que casi siempre se olvida en los presupuestos.

La pregunta que la gente se salta es cuántos usuarios usan el servicio al mismo tiempo en horas pico. Un sistema interno para doscientos empleados tiene un pico muy distinto al de una aplicación dirigida al público general. Si diseñan para el pico, desperdician dinero en horas tranquilas. Si diseñan para el promedio, se saturan cuando hay mucha demanda.

Palancas para reducir el costo

Según mi experiencia, el orden en que conviene considerarlas va de lo barato y de bajo riesgo a lo más laborioso:

  • Elegir un modelo del tamaño justo. Un modelo pequeño con fine-tuning para la tarea exacta puede superar a uno grande de propósito general, y costar mucho menos.
  • Cuantización. Reduce la memoria y acelera, pero hay que medir la calidad.
  • Agrupar solicitudes (batching). Procesar varias solicitudes juntas para que la GPU no esté ociosa. A cambio, cada usuario puede esperar un poco más.
  • Caché (caching). Si muchas personas preguntan lo mismo, o comparten las mismas instrucciones iniciales, no hay que calcularlo desde cero cada vez.
  • Límites de longitud. Los prompts y respuestas largos cuestan dinero por token. Muchos sistemas meten una página completa de instrucciones en cada llamada y nadie recuerda por qué.
PalancaBeneficioCompromiso
Modelo más pequeñoMás barato y rápidoRequiere buen fine-tuning, menor capacidad general
CuantizaciónMenos memoria, más rápidoLa calidad puede bajar, requiere pruebas
BatchingUso eficiente de la GPULa latencia de cada solicitud puede subir
CachingMenos cómputo repetidoMás complejidad cuando el contenido cambia

Una historia de voz a texto

El costo se ve todavía más claro en las cargas de trabajo de voz. Un centro de contacto con miles de llamadas al día necesita transcribirlas. Si requieren el texto mientras la llamada está en curso, deben trabajar en streaming y aceptar GPU que se queden siempre encendidas. Si solo necesitan las transcripciones después, para revisar la calidad, pueden agruparlas y procesarlas por la noche, mucho más barato. Con el mismo modelo de voz a texto (speech to text) en vietnamita, dos requisitos de negocio producen dos facturas distintas. Antes de comprar hardware, pregunten qué tan rápido necesita realmente el negocio el resultado.

Qué medir antes de decidir

  • Tiempo hasta el primer token: cuánto espera un usuario antes de ver la primera palabra.
  • Velocidad de generación mientras corre.
  • Cuántas solicitudes simultáneas aguanta el sistema antes de volverse lento.
  • Costo por cada mil solicitudes, calculado con su tráfico real.
  • Calidad en su propio conjunto de pruebas después de cada compresión o cambio de configuración.

AIVISION es una empresa de IA en Vietnam que entrena LLM en un clúster de 24x NVIDIA H200 y 8x NVIDIA B300, y ha lanzado el modelo de reconocimiento de voz E1.0 y el LLM L1.0 para vietnamita. Nos importa el despliegue porque un gran modelo que no cabe en el presupuesto del cliente no ha resuelto nada. Pueden saber más en AIVISION.

Un hábito que quisiera que todo equipo tuviera: registrar el costo por solicitud desde el primer prototipo. Al principio ese número parece inofensivo, pero les dirá si el producto aguanta cuando los usuarios se multipliquen por diez. Enterarse temprano siempre es mejor que enterarse cuando llega la factura.

Artículos relacionados

Ver todos los artículos