Voz a texto en vietnamita para hospitales y clínicas

01/10/2026

Voz a texto en vietnamita para hospitales y clínicas

Una clínica llena, el médico termina de atender al paciente número veintitantos de la mañana y sigue con los ojos pegados a la pantalla para capturar el expediente. El paciente, sentado enfrente, ve más al médico tecleando que a sí mismo. Quien ha ido a consulta conoce esa sensación. El voz a texto en vietnamita (speech to text) surgió en parte para resolver justo eso: el médico habla, la máquina registra y las personas vuelven a mirarse a la cara.

Es la línea que AIVISION sigue con su modelo de speech to text E1.0. Pero registrar notas clínicas por voz es mucho más difícil que transcribir un discurso, y quiero explicar con claridad dónde está la dificultad.

Por qué la voz en un hospital es un problema aparte

Un modelo de reconocimiento de voz que funciona bien con noticias, podcasts o llamadas de atención a clientes no necesariamente funciona bien en el pasillo de un hospital. Hay varias razones muy concretas.

  • Ruido de fondo: equipos, llamados de turno, familiares platicando, el aire acondicionado zumbando.
  • Vocabulario especializado: términos médicos, nombres de medicamentos, nombres anatómicos, mezclando vietnamita con inglés o latín en la misma frase.
  • Acentos regionales: médicos y pacientes vienen de todas partes, el norte, el centro y el sur suenan distinto, y hay expresiones locales que no aparecen en los libros.
  • Habla abreviada y rápida: el médico de guardia no dicta, murmura como pensando en voz alta.

Los números también dan problemas. Un valor mal leído por un solo dígito puede cambiar por completo el significado, y esa es precisamente la razón por la que el resultado no puede pasar directo al expediente sin que lo revise una persona.

Del texto crudo a la nota clínica estructurada

La transcripción es solo el primer paso. La nota clínica tiene estructura: motivo de consulta, antecedentes, exploración física, plan. Lo que dice el médico no sigue ese molde. Aquí entra el modelo de lenguaje: una vez que la voz se convierte en texto, un LLM puede reorganizarla en secciones según la plantilla de la institución, corregir la ortografía de los términos y marcar los pasajes poco claros para que el médico los revise.

Nos parece razonable un diseño con dos capas separadas. La primera transcribe fielmente lo que se dijo. La segunda lo reorganiza. Separarlas permite saber dónde está el error cuando lo hay: si el oído entendió mal o la mano acomodó mal. Si todo va en un solo bloque, rastrear el error es muy penoso.

Otro principio: lo que el modelo no tiene claro debe quedar a la vista. Una palabra subrayada o marcada para verificar es más útil que una transcripción bonita con errores ocultos. La falsa elegancia es enemiga de la exactitud.

La persona sigue siendo quien firma

Quiero decir algo directamente, porque afecta todo el diseño. Esta herramienta apoya el registro, no sustituye al médico al escribir la nota clínica. El médico relee, corrige y firma. El modelo no emite diagnósticos, no sugiere medicamentos y no agrega al expediente nada que el médico no haya dicho. Si una versión del producto empieza a llenar huecos por su cuenta, ya tomó mal el rumbo.

También ahí el diseño de la interfaz importa más de lo que se piensa. Si la transcripción se ve demasiado completa, un médico cansado tenderá a firmar sin más. Algunos equipos de producto optan por mostrar dos columnas, lo dicho originalmente junto a la versión ya ordenada, para que el cotejo sea sencillo. No digo que sea la única forma, pero refleja algo: una buena herramienta no solo es precisa, también hace fácil la verificación.

Despliegue: lo que no está en el modelo

La mayor parte del tiempo de un proyecto así no se va en el modelo sino en lo que lo rodea.

Micrófono y entorno

La calidad del audio pesa muchísimo. Un micrófono de solapa o de conferencia bien colocado puede ayudar más que una ronda adicional de entrenamiento. Prueben en una clínica real, no en una sala de juntas silenciosa.

Consentimiento del paciente

Grabar la consulta es un tema delicado. Hay que informar con claridad, pedir consentimiento y definir cuánto tiempo se conserva el audio original, o si se conserva. Muchas instituciones procesan y luego borran el audio, y guardan solo el texto ya aprobado por el médico.

Integración al flujo existente

Si el médico tiene que abrir otra aplicación aparte, copiar y pegar, la herramienta se abandona en dos semanas. El texto debe llegar al lugar donde ya trabaja.

Sobre las capacidades, solo digo lo que sé

AIVISION ya lanzó el modelo de speech to text E1.0 para vietnamita y entrena en un clúster de 24 GPU NVIDIA H200 junto con 8 GPU NVIDIA B300. No hemos publicado una tasa de error para ningún entorno hospitalario, porque esa cifra depende de la clínica, del tipo de micrófono, de las voces del equipo y del vocabulario de cada especialidad, y un número genérico solo confunde. Lo que sí estamos dispuestos a hacer es medir con datos reales de la institución, con el consentimiento correspondiente, y revisar juntos los errores antes de hablar de un despliegue amplio.

El fine-tuning por especialidad también es importante. Cardiología, una clínica pediátrica y un laboratorio usan vocabularios distintos. Que el modelo aprenda el vocabulario propio del servicio suele ser un paso razonable, siempre que haya datos conforme a la normativa y alguien que evalúe los resultados.

La carga de papeleo y lo que realmente vale la pena conservar

Se dice mucho que la tecnología ahorra tiempo al médico. Creo que lo más exacto es que puede trasladar el tiempo de la pantalla al paciente. Si una consulta se libera de unos minutos de teclear y el médico mira al paciente un poco más, es un cambio pequeño pero real. En cambio, si la herramienta solo agrega un paso de verificación sin quitar ninguno, todavía no merece quedarse en la clínica. La prueba más sencilla sigue siendo preguntarles a quienes la usan todos los días.

Artículos relacionados

Ver todos los artículos