Fine-tuning de un LLM en vietnamita: datos, SFT y evaluación

01/10/2026

Fine-tuning de un LLM en vietnamita: datos, SFT y evaluación

Lo más difícil de un proyecto de fine-tuning rara vez es el momento de pulsar el botón de entrenamiento. Es lo que ocurre dos semanas antes, cuando todo el equipo discute qué significa que una respuesta sea «correcta». Este artículo cuenta el proceso de fine-tuning de un LLM en vietnamita que solemos seguir en AIVISION, en el orden real del trabajo y con los puntos donde más se tropieza.

Paso 0: definir el problema con ejemplos

Antes de tocar los datos, escriban entre 30 y 50 ejemplos de lo que quieren que el modelo resuelva bien, cada uno con la respuesta que consideran aceptable. Suena rudimentario, pero es el activo más importante de todo el proyecto. Obliga al cliente a ser concreto: «asistente de resúmenes» significa decidir qué tan largo es el resumen, qué se conserva, qué se omite y con qué tono. Ambas partes suelen descubrir en este paso que entendían cosas distintas, y es mucho más barato enterarse aquí que después de entrenar.

Recopilación de datos

Las fuentes suelen ser de tres tipos. Los datos que la organización ya tiene: historiales de chat, correos, actas, documentos de procesos. Los datos públicos adecuados al campo. Y los datos escritos de nuevo por expertos, que suelen ser la parte más pequeña pero más valiosa. Nuestra recomendación es empezar con poco, pero limpio. Un grupo de unos miles de muestras de alta calidad, revisadas por gente del oficio, normalmente da mejores resultados que volcar cientos de miles de muestras sin revisar.

Un consejo sencillo: pidan a un experto del campo que revise unas decenas de muestras al azar antes de ampliar. Suelen señalar de inmediato errores que los ingenieros no ven, como un término mal usado o un proceso que cambió el año pasado. La limpieza, la anonimización y los temas de derechos de autor son tan importantes que les dedicamos un artículo aparte sobre datos de entrenamiento.

Formato y división del conjunto de datos

Los datos para SFT (supervised fine-tuning) tienen la forma de pares de instrucción y respuesta, o de conversaciones de varios turnos. Hay que unificar la plantilla: si lleva system prompt o no, cómo se trata al usuario, qué formato se usa. Si una muestra dice 'Dạ anh' y otra 'Quý khách', el modelo aprenderá un tono revuelto.

Después se divide en tres conjuntos: entrenamiento, validación para dar seguimiento durante la ejecución, y un conjunto de prueba final que se mantiene sellado hasta terminar. El error clásico es la fuga de datos, cuando la misma pregunta, con apenas unas palabras de diferencia, aparece tanto en entrenamiento como en prueba. Entonces la puntuación se ve bien de forma artificial. Eliminen duplicados y casi duplicados antes de dividir.

SFT: las decisiones que sí influyen

La parte del entrenamiento suena a ciencia sofisticada, pero las decisiones prácticas son bastante concretas. Elegir el modelo base: de qué tamaño, cuánta capacidad en vietnamita trae, qué licencia tiene. Elegir entre fine-tuning completo o LoRA. Elegir la tasa de aprendizaje y el número de épocas. Con pocos datos, demasiadas épocas hacen que el modelo memorice y pierda capacidad de generalizar: pierde lenguaje general y responde de forma rígida. La señal conocida es que la pérdida de entrenamiento sigue bajando mientras la de validación empieza a subir.

Otro fenómeno es el «olvido catastrófico» (catastrophic forgetting): el modelo se vuelve bueno en la tarea nueva pero empeora en las anteriores. Para reducirlo se mezcla una parte de datos generales y variados, se usa una tasa de aprendizaje baja o se recurre a LoRA. Toda opción tiene su precio y no hay una fórmula válida para todos los casos, así que conviene correr muchas configuraciones pequeñas y compararlas.

En cuanto a infraestructura, entrenamos en un clúster de 24 GPU NVIDIA H200 y 8 GPU NVIDIA B300. La H200 tiene 141 GB de HBM3e con un ancho de banda de alrededor de 4.8 TB/s, y la B300 unos 288 GB de HBM3e. En fine-tuning, la memoria grande permite usar lotes más grandes y contextos más largos sin fragmentar tanto, y así experimentar más rápido. No lo lean como una promesa de calidad: los datos siguen siendo lo que decide.

Evaluación antes de poner en uso

Este es el paso que más se acorta y también el que más vale la pena conservar. Solemos evaluar en tres niveles.

  • Automática sobre el conjunto de prueba sellado: formato correcto, terminología correcta y contenido correcto frente a la respuesta de referencia, cuando se puede verificar con una máquina.
  • Calificación manual por expertos sobre una muestra representativa, con una escala clara, sobre todo en preguntas de terminología, situaciones ambiguas y casos en los que el modelo debería negarse.
  • Pruebas adversariales: preguntas que se desvían del tema a propósito, preguntas que intentan forzar al modelo a inventar, textos sin acentos, abreviaturas y errores de ortografía.

También hay que comparar contra una línea base: el modelo original con un buen prompt. Si el modelo con fine-tuning apenas lo iguala, el esfuerzo fue en vano y conviene decirlo sin rodeos. Explicamos por qué las puntuaciones de benchmark no bastan en un artículo aparte sobre la evaluación de LLM en vietnamita.

Despliegue y el ciclo posterior

Poner el modelo en uso no es el final. Conviene empezar con un alcance reducido o en modo «sombra» (corre en paralelo y las personas siguen decidiendo), recopilar retroalimentación real y registrar los casos en que el modelo falla. Esos casos son la materia prima de la siguiente ronda de fine-tuning. También hay que vigilar el costo, la latencia y los cambios en la forma en que los usuarios preguntan con el tiempo, porque los datos reales siempre se van alejando de los datos de entrenamiento.

En campos como salud y farmacia agregamos una capa extra de control. El modelo solo apoya con información y trabajo administrativo. No diagnostica, no receta, no recomienda dosis, y toda salida relacionada debe pasar por la revisión y la decisión final de una persona con formación médica.

AIVISION ha lanzado el LLM L1.0 y el speech-to-text E1.0 para vietnamita, y hace fine-tuning para campos específicos. No damos cifras genéricas de compromiso de calidad, porque un número solo significa algo cuando está ligado a un problema y a un conjunto de evaluación concretos. Lo que sí podemos decir es que el proceso descrito, junto con el hábito de medir antes de confiar, ayuda a muchos proyectos a evitar las sorpresas más desagradables.

Artículos relacionados

Ver todos los artículos