El reconocimiento de voz, la comprensión y la síntesis funcionan en nuestros propios servidores, y los datos de sus llamadas permanecen en su región. El agente responde en unos 0,3 segundos, así que su cliente nunca espera — y cuando le interrumpe, la plataforma registra qué parte de la respuesta escuchó realmente.
Nadie nota una buena voz. Se nota el silencio. Una pausa antes de la respuesta es la forma más rápida de que quien llama descubra que no hay nadie.
desde que quien llama termina hasta que el agente empieza
Cada respuesta son tres pasos en secuencia: oír el final del turno de quien llama, decidir qué decir y empezar a decirlo. Cada uno consume milisegundos, y quien llama solo percibe el total. Operar toda la pila nosotros mismos es lo que hace ese total controlable — no hay una cola en la API de un tercero en medio de la frase.
El agente también empieza a hablar antes de haber terminado de componer, como hace una persona, así que la primera palabra llega mientras el resto todavía se produce.
Callarse cuando quien llama habla es la parte fácil. La parte difícil es saber qué trozo de su frase no llegó a oír, y hacer algo al respecto.
En una prueba de estrés grabada sobre uno de nuestros propios agentes de demostración, un evaluador le interrumpió cuatro veces. En la primera interrupción la plataforma registró que quien llamaba había escuchado 76 de los 159 caracteres que el agente estaba pronunciando — el 47 % de la respuesta. Como el dato clave estaba en la mitad no escuchada, el sistema canceló su propio salto a la siguiente etapa, repitió el contenido y solo entonces volvió a su pregunta.
Las otras tres interrupciones llegaron con un 0 % escuchado. El agente acusó recibo, repitió la pregunta pendiente y siguió, sin hablar por encima de quien llamaba y sin perder su lugar.
La prueba de estrés completa, incluido el punto que perdimos →Dos modos de fallo explican la mayoría de las llamadas que salen visiblemente mal. Merece la pena probar los dos antes de comprar.
Un bot guiado por guion reinicia el paso. El agente vuelve a la pregunta que realmente había hecho, con las respuestas ya recogidas en su sitio, así que quien llama nunca es devuelto al principio.
Cuando se le pide confirmar algo que no está en la base de conocimiento, un modelo bajo presión social suele acceder por complacencia. El nuestro está construido para mantener dos afirmaciones separadas en lugar de fundirlas en una respuesta cómoda, y para transferir allí donde falta un dato.
Cómo limitamos la invención →“Soy un asistente digital” es honesto y, por sí solo, un callejón sin salida. El guion lleva una salida explícita — una oferta de devolución de llamada o una transferencia — porque quien pide hablar con una persona y no recibe nada simplemente cuelga.
El reconocimiento, la comprensión y la síntesis son nuestros, en una sola pila. Es a la vez una decisión de latencia y una decisión sobre los datos.
Síntesis de voz, reconocimiento de voz y un modelo de lenguaje — las tres piezas que necesita todo agente de voz, funcionando juntas en lugar de cosidas entre varios proveedores.
Las tres funcionan en nuestros propios servidores, de modo que el audio de sus llamadas, las transcripciones y los datos de sus clientes permanecen en su región y no pasan por servicios de terceros. Si tiene motivos para preferir un proveedor concreto para un componente, podemos integrarlo — y le indicamos por escrito qué componentes son nuestros y cuáles no antes de que el agente atienda una llamada real.
Dónde se procesan sus datos y qué no afirmamos →Nada de esto aparece en una demo. Todo aparece en sus registros de llamadas.
El saludo de un contestador suena como una persona que descuelga, y un argumentario dirigido a un contestador es puro desperdicio. El agente los distingue y trata una máquina como una máquina.
Cómo funciona la detección →Direcciones, grafías, fechas y números se releen y se confirman durante la llamada, porque una entrega en la dirección equivocada cuesta más que la llamada.
Locator revisa el 100 % de las conversaciones con una lista de control acordada con usted. Un equipo de calidad humano alcanza el 3–5 %, cifra propia obtenida de operar llamadas reales.
Qué produce la evaluación de llamadas →