Términos médicos y nombres de medicamentos: por qué falla un LLM
01/10/2026

Hagan un pequeño experimento: denle a un modelo general una nota de consulta en vietnamita, de esas escritas a las prisas, con abreviaturas y palabras en latín intercaladas, y pídanle que la reescriba con claridad. La mayoría de las veces el resultado se lee muy bien. Pero si ustedes son del oficio y lo leen con atención, a veces notarán una abreviatura interpretada con otro sentido, o el nombre de un medicamento cambiado por otro de sonido parecido. Es algo que encuentra seguido quien trabaja con terminología médica en vietnamita y con IA, y es la razón por la que se plantea el fine-tuning de LLM médico.
Este artículo explica por qué ocurren los errores, hasta dónde ayuda el fine-tuning y en qué casos no hay remedio que valga. La perspectiva es la de AIVISION, que hace entrenamiento y fine-tuning de LLM en vietnamita.
Por qué falla un modelo general
No hay una causa única. Son varias capas encimadas.
Pocos datos justo donde se necesitan más
El modelo aprende de los textos que ha leído. El inglés médico tiene un acervo enorme. El vietnamita médico tiene mucho menos, y gran parte está en formatos difíciles de aprovechar: PDF escaneados, documentos internos, expedientes que no se publican por razones válidas. El resultado es que el modelo entiende mejor la terminología en inglés que en vietnamita, y cuando se topa con una denominación adaptada al vietnamita, adivina.
Un concepto, muchos nombres
Una misma cosa puede llamarse con un término sinovietnamita, con el nombre latino original, con el nombre en inglés, con un nombre coloquial y con la abreviatura propia de cada servicio. El médico del oficio entiende por el contexto. El modelo muchas veces no cuenta con ese contexto. Una abreviatura de dos letras puede significar cosas distintas en cardiología y en pediatría.
Los nombres de medicamentos son un caso especial
Los nombres de medicamentos tienen dos niveles: el principio activo y el nombre comercial, y este último lo pone cada laboratorio, a veces con diferencia de una o dos letras. Se transcriben al vietnamita de varias maneras, y los usuarios los teclean sin acentos, los escriben mal o los oyen por teléfono y los anotan. Para un modelo estadístico, dos nombres parecidos en su escritura se confunden con facilidad en uno solo. Es un tipo de error peligroso, porque los dos productos pueden tener usos totalmente distintos.
La seguridad despreocupada
El modelo no tiene sensación de duda. Ante un nombre que nunca ha visto, no dice no sé, sino que genera una respuesta plausible. No es un mal diseño intencional, es consecuencia de cómo aprende: predecir la siguiente palabra más probable.
En qué ayuda el fine-tuning
El fine-tuning es seguir entrenando con datos de un dominio acotado. Bien hecho, aporta varios cambios con sentido.
- El modelo se familiariza con el uso real del lenguaje en el sector salud de Vietnam, incluidas las abreviaturas y la mezcla de idiomas.
- Reconoce mejor las variantes de un nombre: con acentos, sin acentos, transcritas, con los errores de escritura habituales.
- Entiende la estructura de los tipos de documento: expedientes, recetas, etiquetas de medicamentos, instructivos.
- Sabe conservar la terminología al resumir o reescribir, en lugar de parafrasear para que suene bonito.
Pero quiero evitar el tono de milagro. El fine-tuning no convierte al modelo en médico ni en farmacéutico. Lo hace mejor en el lenguaje del dominio, con una comprensión lectora y una redacción más correctas. Entender terminología es distinto de tener criterio clínico, y no usamos el fine-tuning para cruzar ese límite.
Los datos deciden gran parte del resultado
En proyectos de este tipo, el tiempo dedicado a los datos suele ser mayor que el dedicado al entrenamiento. Hace falta un glosario revisado por gente del oficio, con la lista de variantes y abreviaturas por servicio. Hacen falta ejemplos reales de oraciones, tratados para no exponer información personal. Y hacen falta pares de nombres fáciles de confundir, marcados aparte para que el modelo aprenda a distinguirlos.
Lo que me parece más eficaz, aunque no sea vistoso: un glosario elaborado por los propios usuarios finales. El farmacéutico sabe con qué nombre piden los clientes cada producto en su farmacia. El médico de medicina interna conoce tres abreviaturas para el mismo diagnóstico. Ese conocimiento no está en los libros, y ningún modelo lo recoge por su cuenta.
Algo que hay que prever: la terminología cambia. Salen productos nuevos, se actualiza la nomenclatura, los servicios agregan nombres. El glosario debe tratarse como un documento vivo, con alguien responsable de actualizarlo, no como algo que se hace una sola vez.
Cómo medir si mejoró
La sensación de que se lee fluido no es una medición. Lo más confiable es armar un conjunto de preguntas de prueba pequeño pero difícil: pares de nombres fáciles de confundir, abreviaturas con varios significados, oraciones sin contexto. Se ejecuta antes y después del fine-tuning, y especialistas lo califican a mano. Se registra no solo el porcentaje de aciertos sino el tipo de error, porque equivocarse por omisión es muy distinto de equivocarse por invención.
Aquí no daré ninguna cifra de mejora, porque depende de los datos y del problema concretos, y un número tomado de otro lado solo lleva a malentendidos. Si alguien les ofrece un porcentaje exacto de precisión sin decir sobre qué conjunto de datos se midió, pregunten.
Cada cosa en su lugar
AIVISION entrena modelos en un clúster de 24 GPU NVIDIA H200 y 8 GPU NVIDIA B300, ya lanzó el LLM L1.0 para vietnamita junto con el modelo de speech to text E1.0, y hace fine-tuning para dominios como salud y farmacia. Nuestro enfoque es construir una base sólida en vietnamita y luego afinar por dominio junto con la institución usuaria, con datos tratados conforme a la normativa.
Aun así, mantengo un recordatorio para todo el que use este tipo de herramientas: cuando un término o el nombre de un medicamento aparece en el resultado del modelo y es importante para una decisión, cotéjenlo con el documento original. Un mejor modelo comete menos errores, pero no cero. Médicos y farmacéuticos siguen siendo quienes deciden, y la herramienta debe diseñarse para que su cotejo sea rápido, no para que puedan prescindir de él.