Fine-tuning de LLM: qué es y cuándo supera al prompt o a RAG

01/10/2026

Fine-tuning de LLM: qué es y cuándo supera al prompt o a RAG

La pregunta que más escucho de los clientes no es «¿cuál es el mejor modelo?», sino «¿necesitamos hacer fine-tuning?». Y la respuesta honesta, más de la mitad de las veces, es que todavía no. Suena raro viniendo de un equipo que hace fine-tuning de LLM de forma profesional, pero preferimos decirlo así antes que aceptar un proyecto que deje decepcionadas a las dos partes.

Qué es realmente el fine-tuning

Un LLM, después de su entrenamiento inicial, es un enorme bloque de pesos que ya aprendió lenguaje y mucho conocimiento general. El fine-tuning consiste en seguir entrenando ese bloque con un conjunto de datos mucho más pequeño y con un propósito definido, para cambiar su comportamiento. No equivale a «enseñarle conocimiento nuevo» en el sentido ingenuo. Lo que el fine-tuning hace mejor es modificar cómo se comporta el modelo: el tono, el formato de salida, el uso de terminología, la manera de rechazar una petición, la consistencia a lo largo de miles de consultas. Lo hace peor cuando se trata de meterle hechos nuevos que además cambian constantemente.

Hay varios tipos: el fine-tuning de todos los pesos, o técnicas ligeras como LoRA, que actualizan solo una pequeña parte de los parámetros. La versión ligera es más barata, más rápida, más fácil de cambiar y, para la mayoría de los problemas empresariales, un punto de partida razonable. La versión completa conviene cuando se necesita un cambio profundo, por ejemplo añadir un idioma o un campo de conocimiento completos.

Tres herramientas, tres problemas distintos

La forma más fácil de recordarlo es preguntarse: ¿el problema es que el modelo no sabe, no sigue instrucciones o no habla con el estilo correcto?

  • El prompt resuelve que el modelo aún no entiende lo que ustedes quieren. Es lo más barato y se corrige en minutos. Su límite es que un prompt largo consume tokens en cada llamada y, aun así, puede ser ignorado cuando el contexto es extenso.
  • RAG resuelve que el modelo no conoce la información, sobre todo si es privada o cambia con frecuencia, como listas de precios, procesos internos o documentación de producto. Los datos viven fuera del modelo, así que se actualizan cambiando los documentos, sin reentrenar, y se puede citar la fuente.
  • El fine-tuning resuelve que el modelo sabe, pero no se comporta como ustedes lo necesitan, o que se requiere un modelo más pequeño, rápido y barato a gran escala.

Estas tres herramientas no se excluyen entre sí. Un buen sistema suele usar las tres: un modelo con fine-tuning para el tono y el formato, RAG para el conocimiento y prompts para las instrucciones de cada situación.

Señales de que conviene hacer fine-tuning

Según nuestra experiencia, el fine-tuning tiene sentido cuando se dan algunas de estas condiciones. Ya probaron prompts bien trabajados y también few-shot, y la salida sigue desviándose en ciertos casos que se repiten. Necesitan un formato de salida estricto, por ejemplo un JSON con un esquema fijo o actas con la plantilla de la organización, y no quieren pagar por un prompt de miles de tokens en cada llamada. Quieren usar un modelo más pequeño para reducir costo y latencia sin perder calidad en una tarea acotada. Necesitan que los datos se procesen en infraestructura propia por razones de seguridad. O su campo tiene terminología y formas de expresión que un modelo de uso general suele manejar mal, como la salud, la farmacia o el ámbito legal.

En vietnamita hay un motivo más: si el modelo base trabaja mal con el idioma en cuanto al tokenizer o al tono, el fine-tuning puede acercar su comportamiento a cómo hablan los usuarios reales. Explicamos esto en el artículo sobre por qué un LLM en vietnamita necesita entrenamiento propio.

Señales de que todavía no conviene

Si no tienen un conjunto de preguntas de evaluación, no hagan fine-tuning. Sin una vara de medir, no sabrán si el modelo mejoró o empeoró, solo tendrán una impresión. Si el problema es información que cambia seguido, tampoco, porque tendrían que reentrenar cada vez. Si tienen menos de unos cientos de ejemplos y de baja calidad, el problema está en los datos, no en el método. Y si un prompt reescrito con cuidado resuelve el 90 por ciento del problema, deténganse ahí: operar un modelo propio no es barato.

Una trampa común es usar el fine-tuning para «enseñarle» hechos al modelo y luego sorprenderse de que siga inventando. El fine-tuning puede hacer que el modelo hable con más seguridad de un tema que en realidad no domina, de modo que a veces las alucinaciones se vuelven más convincentes. Para información que debe ser exacta palabra por palabra, RAG con verificación de fuentes es más seguro.

Dónde está realmente el costo

Mucha gente piensa que el costo son las GPU. En realidad las GPU son solo una parte. El grueso del esfuerzo está en preparar los datos, redactar guías de etiquetado, revisar la calidad, armar el conjunto de evaluación y dar mantenimiento una vez en uso. Unos pocos miles de ejemplos limpios, revisados por expertos del campo, suelen valer más que cientos de miles obtenidos de forma automática. Describimos el proceso en detalle en el artículo sobre el proceso de fine-tuning de un LLM en vietnamita.

En cuanto al hardware, AIVISION entrena en un clúster de 24 GPU NVIDIA H200 y 8 GPU NVIDIA B300. La H200 tiene 141 GB de HBM3e y la B300 cerca de 288 GB, lo que deja espacio para correr experimentos de fine-tuning iterativos con rapidez, en lugar de esperar en una fila. Pero el hardware solo acorta el tiempo de ejecución; no reemplaza la necesidad de entender el problema.

Una forma breve de tomar la decisión

Antes de empezar, respondan tres preguntas con ejemplos reales, no con impresiones. ¿Al modelo le falta información o le falta comportamiento? ¿Ya tienen un conjunto de evaluación de al menos algunas decenas de casos representativos? ¿El costo y la latencia de la solución actual son realmente un problema? Si falta información, vayan por RAG. Si falta comportamiento y ya cuentan con una forma de medir, entonces el fine-tuning es un candidato serio.

En salud y farmacia añadimos una restricción más: el modelo solo apoya con información y tareas administrativas, como redactar borradores de resúmenes o consultar documentos. No diagnostica, no receta, no recomienda dosis. La decisión final es del profesional médico, y el sistema debe diseñarse para que la revisión humana sea fácil, no más difícil.

AIVISION ha lanzado el modelo LLM L1.0 para vietnamita y hace fine-tuning para campos específicos. Si quieren conocer nuestra visión general sobre la IA en Vietnam, la página principal de AIVISION incluye una presentación.

Artículos relacionados

Ver todos los artículos