ASI Robotics AI · web · robotics
← Todos los servicios

Agentes de voz con IA

Un agente de voz con IA que por sí mismo llama a los clientes y atiende las entrantes, con voz natural, 24/7. Llamadas a la base, recepción de solicitudes, registro de citas, cualificación de leads, en lugar de un operador o como apoyo a él.

desde 590 € Hablar de la tarea
$ ./voice.sh call
> STT/TTS + telefonía listos
el agente llama y responde

Qué incluye el servicio de agentes de voz

Diseñamos y montamos un agente de voz con IA que por sí mismo llama a la base de contactos y atiende las llamadas entrantes según su guion. El trabajo incluye la redacción de los guiones de diálogo y la lógica de ramificaciones, la elección y configuración de los motores de reconocimiento y síntesis de voz, la conexión a la telefonía a través de SIP y la integración con su CRM o base de contactos. El equipamiento de comunicación, las líneas telefónicas y los servidores siguen siendo suyos o del proveedor; nosotros escribimos la parte de software, la configuramos para sus números y canales y la llevamos al estado de producción. Por separado desarrollamos el manejo de los rechazos: qué dice el agente ante una llamada no contestada, una transferencia a un operador o una respuesta no reconocida. Como resultado obtiene un circuito de voz configurado con registros de las conversaciones y métricas de contacto, no una demo abstracta.

Cómo oye y habla el agente

En esencia, un agente de voz es la combinación de cuatro bloques que trabajan en tiempo real. El audio entrante de la línea va al módulo de reconocimiento de voz (STT), que convierte las palabras del interlocutor en texto; después el modelo de lenguaje (LLM) decide según el guion qué responder, y la síntesis de voz (TTS) reproduce la respuesta de vuelta a la línea. Todo esto pasa por la telefonía SIP, que mantiene la propia conexión y transmite el flujo de audio entre el abonado y el sistema. Es crítica la latencia del ciclo completo: si la respuesta llega más tarde de un segundo o segundo y medio, la conversación se percibe como hablar con un robot, por eso los bloques se eligen y configuran para una respuesta mínima. Montamos esta cadena sobre la infraestructura del cliente o del proveedor y calibramos cada unión, en vez de simplemente conectar servicios ya hechos al azar.

De dónde surgió la tecnología del habla

La síntesis de voz por máquina se remonta al Voder, el dispositivo que Homer Dudley y su equipo en Bell Labs mostraron en la Exposición Universal de 1939; surgió de los trabajos de Dudley sobre el vocoder, en marcha desde 1926. El reconocimiento apareció después: en 1952 esos mismos Bell Labs construyeron el sistema Audrey, que distinguía los dígitos pronunciados por sus formantes, y en 1962 IBM mostró Shoebox, que entendía 16 palabras. En los años 70 el programa de DARPA (1971-1976) condujo al sistema HARPY de la Universidad Carnegie Mellon, que en 1976 ya reconocía cerca de mil palabras gracias a un algoritmo de búsqueda en haz. Estas máquinas tempranas trabajaban con un vocabulario diminuto, pero demostraron que un ordenador es capaz, en principio, tanto de oír como de hablar. El agente de voz con IA actual es la continuación directa de esa línea, solo que el vocabulario y la calidad han crecido en órdenes de magnitud.

Por qué deciden el software y la configuración

El hardware para una llamada es igual de accesible para todos, y la diferencia en el resultado la marca precisamente la parte de software: el guion, la precisión del reconocimiento y la calidad de la voz. Si el STT confunde «sí» y «no» o pierde números, el agente lleva la conversación por el camino equivocado, y ninguna telefonía lo arregla: el error nace en el software y en su ajuste a su léxico, sus acentos y el ruido de la línea. La síntesis tampoco es neutra: un habla poco natural o entrecortada hace que la gente cuelgue en los primeros segundos, por eso la voz se elige y se afina según la tarea, en lugar de ponerse por defecto. El guion debe cubrir las ramas reales de la conversación, incluidas las interrupciones, las pausas y las respuestas atípicas, de lo contrario el agente se rompe en el primer diálogo real. Lo abordamos como un problema de ingeniería: medimos la proporción de reconocimientos correctos y la efectividad de la llamada, y no nos fiamos de una demostración con una voz limpia de estudio.

Con qué herramientas trabajamos

El stack del agente de voz se construye sobre cuatro componentes, y cada uno lo elegimos según el idioma, el presupuesto y la carga del cliente. El STT se encarga de pasar el habla a texto y se ajusta a los idiomas necesarios, la terminología del sector y la calidad telefónica del sonido. El TTS sintetiza la respuesta con una voz que se elige según el público y se comprueba en cuanto a naturalidad e inteligibilidad en la línea. La telefonía SIP enlaza al agente con números y operadores reales, garantiza la recepción e iniciación de llamadas y se acopla a su centralita o a su proveedor. El LLM mantiene la lógica del diálogo sobre el guion: entiende la intención del interlocutor y formula las respuestas dentro de las reglas establecidas. Los motores concretos de cada bloque son intercambiables, y elegimos la combinación según la latencia, el precio por minuto y la precisión sobre su material, mientras que la infraestructura la configuramos del lado del cliente.

Cuándo aparecieron los estándares clave

El primer sistema completo de síntesis de voz a partir de texto para el inglés lo montó el equipo de Noriko Umeda en el Laboratorio Electrotécnico japonés en 1968. El punto de inflexión comercial lo dio DECtalk, de Digital Equipment Corporation, en 1984; precisamente con su voz reconocible habló durante años Stephen Hawking. La era de la síntesis con redes neuronales comenzó en 2016 con WaveNet, de DeepMind, que por primera vez generaba la onda sonora directamente y fijó el listón de naturalidad de las voces actuales; el reconocimiento pasó a las redes neuronales antes, apoyándose entre otros en la LSTM de Hochreiter y Schmidhuber de 1997. La base telefónica la sentó el protocolo SIP: la primera versión salió como RFC 2543 en 1999, y la edición vigente, RFC 3261, en junio de 2002. Sobre estas fechas de referencia se sostiene toda la telefonía de voz moderna con inteligencia artificial.

Por qué puede confiárnoslo

La experiencia total de nuestro equipo de desarrollo en TI supera los 45 años, y el circuito de voz lo montamos como ingenieros, no como vendedores de cajas ya hechas. No fabricamos hardware y lo decimos con honestidad: sus líneas y equipos siguen siendo suyos, nuestra zona de responsabilidad es el guion, el reconocimiento, la síntesis, la integración SIP y el ajuste a sus llamadas reales. Antes del lanzamiento en producción el sistema pasa por pruebas con diálogos reales: medimos la precisión del reconocimiento, la efectividad de la llamada y el comportamiento del agente ante respuestas atípicas, y corregimos antes de que marque al primer cliente. Los registros y las métricas están abiertos, así que se ve dónde funciona el agente y dónde hay que mejorar el guion. Este enfoque elimina el principal riesgo de un agente de voz con IA: un lanzamiento a ciegas que hunde la conversión y la reputación en los primeros cientos de llamadas.

Qué incluye

Guiones de llamadas y diálogos
Voz natural (síntesis de voz, TTS)
Reconocimiento del habla del cliente (STT)
Llamadas salientes a la base
Recepción de entrantes 24/7
Transcripción y cualificación → CRM
Conexión de la telefonía (SIP)

Cómo trabajamos

01
Tarea
02
Guion
03
Voz
04
Telefonía
05
Lanzamiento
Resultado

El agente atiende el 100% de las llamadas y llama a la base por sí mismo: los operadores se descargan y las solicitudes no se pierden de noche ni en hora punta.

Preguntas frecuentes

¿Es un contestador automático?+

No: el agente de IA mantiene un diálogo real por voz, entiende las respuestas y reacciona, no lee un menú.

¿A dónde llegan las solicitudes?+

A su CRM, con la transcripción en texto de cada conversación.

¿Hablamos de tu proyecto?

Deja tus datos y te contactamos con preguntas y una propuesta.