Datos de entrenamiento para un LLM en vietnamita: limpieza y derechos
01/10/2026

En el gremio hay una frase que ya me cansé de oír, pero que sigo creyendo cierta: un modelo vale lo que valen sus datos. Cansa porque suena a eslogan. Es cierta porque, cada vez que un proyecto fracasa y se rastrea la causa, casi siempre está en algún archivo de datos que nadie leyó con atención. Este artículo trata de los datos de entrenamiento para un LLM en vietnamita: las tareas tediosas que hay que hacer y las trampas que en AIVISION hemos visto repetirse una y otra vez.
Limpieza: el trabajo que nadie quiere presumir
Los datos crudos en vietnamita suelen venir mezclados con de todo. Código HTML que quedó, caracteres extraños por errores de codificación, letras con los acentos rotos al convertir desde formatos viejos, párrafos repetidos una docena de veces, encabezados y pies de página de documentos escaneados metidos a media oración. Solo el tema de Unicode ya es una pena. La misma letra 'ệ' puede guardarse en forma precompuesta o en forma combinada (la letra más el signo suelto). A simple vista se ven idénticas, pero para la máquina son dos cadenas distintas. Si no se normalizan a una sola forma, el tokenizer las trata como dos palabras y el modelo aprende de manera más diluida. El primer paso casi siempre es normalizar Unicode.
Luego viene el filtrado de calidad. Se descartan textos demasiado cortos, con demasiados símbolos o con una proporción anormalmente alta de caracteres que no son vietnamita. Se eliminan duplicados, tanto exactos como casi idénticos. La traducción automática cruda también debe eliminarse o recibir menos peso, porque el modelo aprende ese tono forzado. Eso sí, no se pasen con el filtro. He visto equipos que filtraron con tanta fuerza que borraron todo el texto sin acentos y todo el texto con abreviaturas, y después el modelo entrenado no entendía los mensajes de usuarios reales. Lo «sucio» que los usuarios realmente escriben es a veces justo lo que hay que conservar, de forma selectiva.
Anonimización: fácil de decir, difícil de hacer
Los datos empresariales, sobre todo chats con clientes, expedientes médicos y documentos internos, contienen mucha información personal: nombres, teléfonos, direcciones, números de identificación, correos, placas de vehículos, códigos de paciente. Antes de entrenar, hay que ocultarlos o sustituirlos.
Los pasos prácticos incluyen usar reglas (regex) para los patrones estructurados como teléfonos, correos y números de identificación, usar un modelo de reconocimiento de entidades para nombres de personas y direcciones, y reemplazarlos por etiquetas consistentes, por ejemplo que una misma persona sea siempre [PERSONA_1] dentro de una conversación para mantener el hilo del texto. Después hay que revisar a mano una muestra aleatoria. Los nombres vietnamitas son más difíciles de lo que parece: 'Hoa', 'Lan', 'Sáng' y 'Bình' son también sustantivos o adjetivos comunes. Las direcciones abreviadas o sin acentos son aún más difíciles de detectar.
Hay dos puntos que conviene reconocer. La anonimización rara vez es perfecta, por lo que hay que sumar otras medidas: limitar quién accede a los datos, entrenar en infraestructura propia y llevar registros. Además, hay información que sigue permitiendo identificar a alguien al combinarse, como una serie de detalles poco comunes, aunque cada detalle por separado esté oculto. Con datos médicos, el nivel de cautela debe ser mucho mayor, y conviene que la persona responsable de lo legal o del cumplimiento normativo de la organización participe desde el principio, no cuando el entrenamiento ya terminó.
Derechos de autor y derecho de uso
La pregunta «¿estos datos se pueden usar para entrenar?» no tiene una respuesta general. Depende del origen, la licencia, los términos del sitio de origen, los acuerdos con el cliente y la legislación aplicable. No somos asesores legales, así que no damos una conclusión general, pero sí tenemos algunos principios de trabajo.
- Registren la fuente de cada conjunto de datos y la licencia que lo acompaña. Sin este paso, dos años después nadie podrá responder «¿de dónde salió esto?».
- Los datos de clientes se usan solo dentro del alcance acordado, y conviene dejar por escrito si se usan para entrenar y quién es dueño del modelo tras el fine-tuning.
- El contenido con derechos de autor, como libros, periódicos o documentos de paga, debe revisarse por separado; no se debe asumir que se puede tomar solo porque «está en internet».
- Ante la duda, consulten a un abogado o descarten esa fuente. La calidad del modelo casi nunca depende de una sola fuente dudosa.
Las trampas más frecuentes
La fuga entre el conjunto de entrenamiento y el de prueba es la trampa clásica. La puntuación sale altísima porque el modelo ya vio el examen. Y si ya lo vio, hay que eliminar duplicados y casi duplicados antes de dividir los conjuntos.
Sesgo de tono y de región. Si los datos de chat provienen en su mayoría de una sucursal del norte, el modelo hablará con ese tono y responderá de forma torpe a clientes del sur. Si todos los documentos médicos vienen de un solo hospital, el modelo reflejará los hábitos y la terminología propios de ese lugar.
Etiquetas incorrectas o inconsistentes. Cuando varias personas escriben las respuestas modelo, cada una con su estilo, e incluso contradiciéndose en los procesos, el modelo aprende el desorden. Una guía clara para redactar las muestras y una ronda de revisión cruzada cuestan mucho menos que reentrenar.
Datos obsoletos. Los precios, las normas y los procesos cambian, pero el modelo sigue respondiendo con la versión vieja y con total seguridad. Para la información que cambia seguido, conviene mantenerla fuera del modelo y recuperarla al momento de ejecutar, en lugar de meterla en los pesos.
Datos sintéticos generados por otro modelo. Son cómodos y baratos, pero si no se revisan, los errores y el estilo de máquina se amplifican en cada generación. Úsenlos de forma selectiva, con alguien que los lea, y no los traten como fuente de verdad.
Un hábito que vale la pena
Les propongo un hábito muy sencillo: antes de entrenar, que todo el equipo se siente a leer 100 muestras al azar, leerlas de verdad, no hojearlas. Una vez, con este método, nuestro equipo descubrió que toda una sección de muestras empezaba con el mismo saludo larguísimo. Un filtro automático quizá no lo detecta; el ojo humano sí.
En salud y farmacia, los datos deben ser revisados además por expertos médicos. El modelo es solo una herramienta de apoyo para información y tareas administrativas: no diagnostica, no receta, no recomienda dosis. Una muestra que, sin querer, le enseñe al modelo a hablar como si diera indicaciones médicas debe eliminarse de inmediato.
AIVISION entrena en un clúster de 24 GPU NVIDIA H200 y 8 GPU NVIDIA B300, pero buena parte de ese cómputo no sirve de nada si la entrada está sucia. Para nosotros, invertir en datos siempre rinde más que invertir en más hardware, lo cual suena contradictorio viniendo de una empresa con muchas GPU.