Minutas de reunión con speech to text en vietnamita: qué sí funciona

01/10/2026

Minutas de reunión con speech to text en vietnamita: qué sí funciona

Quien alguna vez ha sido secretario de reuniones conoce la sensación: escuchar, teclear y preocuparse por no perder una decisión importante, y al final las notas son fragmentos que ya nadie entiende. Usar speech to text en vietnamita para hacer las minutas suena como la solución obvia a ese problema. Resuelve una parte, y de la otra hay que hablar con franqueza, porque toda herramienta tiene algo que todavía no hace bien.

Lo que sí hace la máquina

Lo primero es transcribir. Una reunión de una hora se convierte en texto completo y con búsqueda. ¿Recuerdan que alguien mencionó la fecha de entrega del informe, pero no en qué momento? Basta teclear la palabra clave. Solo esto ya cambió la forma de trabajar de muchos equipos, porque acaba con discusiones del tipo "ese día tú dijiste esto".

Lo segundo es usar un modelo de lenguaje para condensar la transcripción en una minuta: los puntos principales, las decisiones tomadas, las tareas con su responsable y las preguntas que quedaron abiertas. Aquí es donde el LLM en vietnamita aporta valor, porque tiene que entender la estructura de una reunión y no solo juntar palabras. Combinar speech to text con un LLM es una arquitectura razonable, y también es el camino que le interesa a AIVISION, ya que contamos con el modelo de speech to text E1.0 y con el modelo LLM L1.0 para vietnamita.

Qué lleva una buena minuta

  • Datos generales: fecha y hora, asistentes.
  • Las decisiones, una por renglón, con el responsable claro.
  • Lista de pendientes: quién, qué y para cuándo.
  • Temas abiertos que requieren otra reunión.

A la máquina le resulta fácil armar este esqueleto. Pero lo que va dentro tiene que ser revisado por quienes estuvieron en la reunión.

Dónde todavía hay obstáculos

Una vez probé con un fragmento de una reunión interna real, con seis personas, en un sistema de transcripción. El resultado se podía leer, pero tenía errores muy característicos. El grupo suele hablar encimado cuando se anima la discusión, y ahí es donde la máquina más se confunde. Se mezclan quién dijo qué, y en una minuta lo que importa es la persona correcta.

Distinguir a los hablantes (speaker diarization) sigue siendo un problema difícil, sobre todo cuando todos están en la misma sala y comparten un solo micrófono. Si cada quien trae sus propios audífonos, tienen canales de audio separados y el problema se reduce bastante. Una sala grande con un micrófono en medio de la mesa es otra historia: eco, gente sentada lejos que habla bajito, el ventilador, el ruido del teclado.

Y luego el idioma. Las reuniones de trabajo en Vietnam mezclan vietnamita con inglés todo el tiempo, desde palabras como "deadline", "KPI" o "pipeline" hasta frases completas. Súmenle las siglas internas, los nombres de proyectos y de clientes. Los modelos generales suelen transcribir mal estas palabras, y el LLM que viene después intenta "adivinar lo que tiene sentido", a veces generando una oración que suena muy fluida pero que nadie dijo.

El mayor problema: resúmenes que suenan bien pero están mal

Este es el riesgo que más me preocupa. El resumen que genera un LLM suele ser muy fluido, y precisamente esa fluidez hace que el lector baje la guardia. Una decisión de "posponer a la próxima semana" puede quedar escrita como "cancelar". Una tarea asignada a Lan puede atribuirse a Hùng porque ambos se mencionaron en el mismo párrafo. Nadie lo hace a propósito, pero una minuta equivocada tiene consecuencias reales.

Por eso el proceso debería tener dos capas de protección. Una: la minuta siempre incluye un enlace al fragmento original de la transcripción, para que quien dude pueda abrirlo y volver a escucharlo. Dos: los puntos que implican un compromiso, como decisiones, fechas límite y cifras, deben ser confirmados por quien presidió la reunión antes de enviarse. Cuesta unos minutos más, pero evita tener que hacer otra reunión completa para corregir un malentendido.

Sobre la confidencialidad

Una reunión de la dirección o una sobre recursos humanos no es algo que quieran subir a un servicio externo sin saber dónde se almacena. Pregunten con claridad dónde se procesan los datos, cuánto tiempo se guardan y si se usan para volver a entrenar el modelo. Para muchas organizaciones, la implementación en sus propias instalaciones es un requisito obligatorio, y el diseño del sistema debería considerarlo desde el inicio.

Cómo usarlo correctamente

En mi experiencia, los equipos que lo aprovechan bien hacen cosas muy sencillas. Dicen su nombre la primera vez que hablan, para facilitar la identificación del hablante. Usan un micrófono de buena calidad, porque el audio de entrada determina gran parte del resultado. Preparan de antemano una lista de términos y nombres propios del proyecto. Y consideran que lo que genera la máquina es un primer borrador, no la versión final.

Si quieren saber más sobre cómo aborda AIVISION el vietnamita, del reconocimiento de voz a los modelos de lenguaje, pueden revisar el sitio web. En cuanto a las minutas: que la máquina se encargue de transcribir y armar el esqueleto, y que las personas se encarguen de confirmar. Repartido así el trabajo, cada quien hace lo que mejor sabe hacer.

Artículos relacionados

Ver todos los artículos