Call center con IA on-premise en una GPU de 8 GB: qué se necesita

05/10/2026

Call center con IA on-premise en una GPU de 8 GB: qué se necesita

“Las grabaciones de los clientes no salen de este edificio.” Imaginen esa frase dicha en la junta del lunes, justo después de que el equipo de atención a clientes presentó su plan de voicebot. Quien la dice es la responsable de cumplimiento, y no está bromeando. El problema cambia de forma en ese momento: ya no se trata de qué servicio en la nube elegir, sino de cómo correr un call center con IA on-premise, dentro del propio cuarto de servidores de la empresa.

AIVISION solution demo
Video corto: s2speech

La buena noticia es que esto pesa menos de lo que muchos creen. La versión Speech-to-Speech de s2speech es gratuita, funciona en tiempo real, se puede instalar on-premise y cabe en una sola GPU de unos 8 GB de VRAM, tipo RTX 2080 Ti, con 8 conversaciones simultáneas. La noticia menos alegre: “se instala” y “funciona bien todos los días” son dos cosas distintas. Aquí va lo que hay que preparar y dónde suelen tropezar los equipos.

Qué tiene que estar sobre la mesa

  • Un servidor con una GPU de unos 8 GB de VRAM. No hace falta un clúster caro; una tarjeta tipo RTX 2080 Ti alcanza para la versión Speech-to-Speech. Eso sí, dediquen esa GPU solo a esta tarea y no la pongan a compartir memoria con otros procesos.
  • La conexión con el conmutador. El servicio Text-to-Speech de s2speech ya ofrece salida de 8 kHz G.711 μ-law y A-law para conmutadores Asterisk y FreeSWITCH. Para la versión on-premise, pregunten desde el inicio por los formatos de audio de entrada y salida, para no terminar transcodificando a medio camino.
  • Guiones y datos del negocio. Un voicebot solo responde bien cuando está conectado a donde viven las respuestas: agenda de citas, estado de pedidos, políticas de devolución. Suele ser la parte que más tiempo consume, y ninguna GPU la hace por ustedes.
  • Alguien que se haga cargo del sistema. Quién revisa los logs, quién escucha las llamadas fallidas, quién corrige el guion. Sin ese rol, los proyectos suelen morir en silencio a las pocas semanas.

8 sesiones simultáneas, bien entendidas

8 CCU significa que en un mismo instante esa GPU atiende hasta 8 conversaciones. No son 8 llamadas al día, ni 8 agentes virtuales sentados esperando. Si una novena llamada entra cuando las 8 sesiones están ocupadas, tiene que ir a algún lado: a una cola, a un agente humano o a otro servidor.

Por eso, antes de comprar cualquier cosa, saquen los registros del conmutador y vean cómo son sus horas pico. Hay líneas que pasan el día tranquilas y solo se saturan a primera hora y después de la comida. Otras van parejas de la mañana a la noche. Lo que define cuántas GPU necesitan es el número de llamadas simultáneas en el pico, no el total de llamadas del mes.

Un consejo práctico: no diseñen el voicebot para que se trague todo. Denle los tipos de llamada con estructura y, cuando las sesiones estén llenas o el cliente pida hablar con una persona, transfieran directo al equipo de agentes. Al cliente no le importa quién contesta. Le importa que alguien conteste.

Dónde se tropieza ya en producción

El audio telefónico no es el audio de la demo

Las demos suelen hacerse con un buen micrófono en un cuarto silencioso. Las llamadas reales viajan por líneas telefónicas de banda angosta, con motos, niños y gente en altavoz de fondo. Prueben con las grabaciones de su propio conmutador. Hasta las cifras internas que publica AIVISION muestran una brecha entre la voz leída y el audio de la vida real: una tasa de error por palabra de 4.58% en FLEURS-vi, pero de 20.29% en juntas de negocios reales, medida con datos que no se usaron para entrenar.

Números, dinero y fechas

El Speech-to-Text de s2speech está hecho para entender números, montos, fechas y vietnamita mezclado con inglés. Aun así, el guion debe hacer que el voicebot repita códigos de pedido, montos y fechas de cita para que el cliente los confirme. Un rápido “le repito los datos” cuesta unos segundos y puede evitar toda una queja.

La operación después del arranque

On-premise significa que ustedes se encargan de lo que normalmente resuelve un proveedor en la nube: monitorear temperatura y memoria de la GPU, respaldar la configuración, actualizar versiones y tener un plan para cuando el servidor se reinicie a media jornada. Siempre dejen una salida: si el equipo de IA deja de responder, el conmutador debe regresar las llamadas a las personas de forma automática.

Datos y accesos

Mantener los datos en casa es la razón principal para ir on-premise, así que no dejen que se escapen por la puerta de atrás. Quién puede escuchar grabaciones, cuánto tiempo se guardan las transcripciones, si los logs ocultan los números de cuenta de los clientes. Esas preguntas merecen respuestas por escrito antes de salir a producción.

Un plan piloto sin rodeos

Si todavía les parece buena idea, un plan sencillo podría verse así. Prototipen el guion con las API de la plataforma, usando frases que grabe su propio equipo o datos sintéticos, todavía sin grabaciones reales de clientes. Según s2speech.com, por ahora cada cuenta tiene 10 dólares de uso gratis al día, sin tarjeta, así que esta etapa puede arrancar antes de pedir presupuesto. Cuando el guion esté sólido, pasen a la versión Speech-to-Speech on-premise, pónganla a trabajar en paralelo con agentes humanos en una línea de bajo riesgo, escuchen las llamadas fallidas todos los días y solo crezcan cuando la proporción de llamadas transferidas a personas haya bajado y se mantenga estable.

Los detalles de cada servicio están en la página de producto de s2speech, y la cuenta de prueba se crea en s2speech.com. El equipo de AIVISION ha implementado IA de voz en Vietnam, Estados Unidos, México, Filipinas y Tailandia, así que preguntas como “nuestro conmutador tiene una configuración rara” tienen a quién dirigirse.

¿Y la responsable de cumplimiento? No necesita saber qué es la VRAM. Solo necesita ver el diagrama y comprobar que ninguna flecha de datos cruza la pared de la empresa. Con on-premise, ese diagrama sí se puede dibujar. Solo pidan a AIVISION que confirme por escrito una cosa: que la versión on-premise funciona por completo dentro de su red, sin llamadas hacia afuera.

Artículos relacionados

Ver todos los artículos