tecnología

La tecnología bajo el capó

El reconocimiento de voz, la comprensión y la síntesis funcionan en nuestros propios servidores, y los datos de sus llamadas permanecen en su región. El agente responde en unos 0,3 segundos, así que su cliente nunca espera — y cuando le interrumpe, la plataforma registra qué parte de la respuesta escuchó realmente.

velocidad de respuesta

La latencia es lo que delata, y es un presupuesto, no una función

Nadie nota una buena voz. Se nota el silencio. Una pausa antes de la respuesta es la forma más rápida de que quien llama descubra que no hay nadie.

0.3 seg

desde que quien llama termina hasta que el agente empieza

A dónde se va el tiempo

Cada respuesta son tres pasos en secuencia: oír el final del turno de quien llama, decidir qué decir y empezar a decirlo. Cada uno consume milisegundos, y quien llama solo percibe el total. Operar toda la pila nosotros mismos es lo que hace ese total controlable — no hay una cola en la API de un tercero en medio de la frase.

El agente también empieza a hablar antes de haber terminado de componer, como hace una persona, así que la primera palabra llega mientras el resto todavía se produce.

interrupciones

Todos los proveedores dicen que gestionan las interrupciones. Pregunte qué miden

Callarse cuando quien llama habla es la parte fácil. La parte difícil es saber qué trozo de su frase no llegó a oír, y hacer algo al respecto.

Tres preguntas a la vez

  • ¿Ha empezado a hablar quien llama? Detectado en el audio, no al expirar un temporizador de silencio.
  • ¿Cuánto de mi respuesta ha escuchado? La plataforma registra el punto del enunciado en el que quien llama interrumpió.
  • ¿Qué hago con la parte que se ha perdido? Si la información importante estaba en la mitad no escuchada, se vuelve a formular antes de que la conversación avance.

Cómo se ve esto en un registro

En una prueba de estrés grabada sobre uno de nuestros propios agentes de demostración, un evaluador le interrumpió cuatro veces. En la primera interrupción la plataforma registró que quien llamaba había escuchado 76 de los 159 caracteres que el agente estaba pronunciando — el 47 % de la respuesta. Como el dato clave estaba en la mitad no escuchada, el sistema canceló su propio salto a la siguiente etapa, repitió el contenido y solo entonces volvió a su pregunta.

Las otras tres interrupciones llegaron con un 0 % escuchado. El agente acusó recibo, repitió la pregunta pendiente y siguió, sin hablar por encima de quien llamaba y sin perder su lugar.

La prueba de estrés completa, incluido el punto que perdimos →
sostener el hilo

Mantener el lugar y no inventar una respuesta

Dos modos de fallo explican la mayoría de las llamadas que salen visiblemente mal. Merece la pena probar los dos antes de comprar.

01

El contexto tras la interrupción

Un bot guiado por guion reinicia el paso. El agente vuelve a la pregunta que realmente había hecho, con las respuestas ya recogidas en su sitio, así que quien llama nunca es devuelto al principio.

02

Decir “no lo sé”

Cuando se le pide confirmar algo que no está en la base de conocimiento, un modelo bajo presión social suele acceder por complacencia. El nuestro está construido para mantener dos afirmaciones separadas en lugar de fundirlas en una respuesta cómoda, y para transferir allí donde falta un dato.

Cómo limitamos la invención →
03

Una salida hacia una persona

“Soy un asistente digital” es honesto y, por sí solo, un callejón sin salida. El guion lleva una salida explícita — una oferta de devolución de llamada o una transferencia — porque quien pide hablar con una persona y no recibe nada simplemente cuelga.

en nuestros propios servidores

Los datos nunca salen de nuestra infraestructura

El reconocimiento, la comprensión y la síntesis son nuestros, en una sola pila. Es a la vez una decisión de latencia y una decisión sobre los datos.

TTSSTTLLM

Síntesis de voz, reconocimiento de voz y un modelo de lenguaje — las tres piezas que necesita todo agente de voz, funcionando juntas en lugar de cosidas entre varios proveedores.

Una pila autónoma

Las tres funcionan en nuestros propios servidores, de modo que el audio de sus llamadas, las transcripciones y los datos de sus clientes permanecen en su región y no pasan por servicios de terceros. Si tiene motivos para preferir un proveedor concreto para un componente, podemos integrarlo — y le indicamos por escrito qué componentes son nuestros y cuáles no antes de que el agente atienda una llamada real.

Dónde se procesan sus datos y qué no afirmamos →
también trabajando en cada conversación

La maquinaria poco lucida que decide si funciona

Nada de esto aparece en una demo. Todo aparece en sus registros de llamadas.

Detecta buzones de voz

El saludo de un contestador suena como una persona que descuelga, y un argumentario dirigido a un contestador es puro desperdicio. El agente los distingue y trata una máquina como una máquina.

Cómo funciona la detección →

Verifica lo que ha anotado

Direcciones, grafías, fechas y números se releen y se confirman durante la llamada, porque una entrega en la dirección equivocada cuesta más que la llamada.

Evalúa después cada llamada

Locator revisa el 100 % de las conversaciones con una lista de control acordada con usted. Un equipo de calidad humano alcanza el 3–5 %, cifra propia obtenida de operar llamadas reales.

Qué produce la evaluación de llamadas →
preguntas que nos hacen los ingenieros

Preguntas frecuentes

¿Qué latencia debe alcanzar realmente un agente de voz?
La cifra que importa es el hueco que percibe quien llama entre el final de su frase y la primera palabra de la respuesta. La nuestra es de unos 0,3 segundos. Más allá de un segundo aproximadamente, quien llama empieza a llenar el silencio: repite la pregunta, dice «¿hola?» o cuelga, y ninguna calidad de voz recupera eso. Pida al proveedor la cifra medida de extremo a extremo en una línea telefónica real, no el tiempo de inferencia del modelo.
¿Qué es el barge-in y por qué importa?
El barge-in es que quien llama hable por encima del agente. Gestionarlo implica tres cosas: detectar la interrupción en el audio en lugar de esperar a que expire un temporizador de silencio, callarse limpiamente y saber cuánto de la respuesta escuchó quien llama antes de interrumpir. La tercera es la que la mayoría de los sistemas se salta, y es la que decide si el agente repite la parte perdida o continúa como si la frase hubiera llegado.
¿Qué modelos de voz y de lenguaje utilizan?
El reconocimiento de voz, el modelo de lenguaje y la síntesis de voz funcionan todos sobre infraestructura que operamos nosotros, lo que nos permite controlar el presupuesto de latencia y mantener los datos de llamada dentro de la región. Si tiene un motivo concreto para preferir un proveedor determinado para un componente, podemos integrarlo, y confirmamos por escrito qué componentes son nuestros antes de la puesta en marcha. No publicamos un diagrama de la pila, porque la respuesta honesta cambia a medida que reemplazamos partes de ella.
¿Dónde se procesan los datos de nuestras llamadas y cuánto tiempo los conservan?
El audio de las llamadas, las transcripciones y los campos que recoge el agente se procesan en nuestros propios servidores y permanecen en la región. Los plazos de conservación, los papeles de responsable y encargado del tratamiento, y nuestro representante designado en la Unión Europea conforme al artículo 27 del RGPD se exponen en la página de seguridad y cumplimiento. Esa página también dice con claridad qué certificaciones no tenemos, porque un proveedor que enumera normas sin haber sido auditado es un problema mayor que no tenerlas.
¿Cómo evitan que el agente invente una respuesta?
El agente responde a partir del material que usted nos entrega, y donde falta un dato lo correcto es decirlo y transferir, no rellenar el hueco. El modo de fallo que merece prueba no es la invención espontánea sino quien llama y plantea una premisa falsa con presión social detrás: «me dijeron que tienen un especialista en X». Pida al proveedor que ejecute esa sonda delante de usted y observe si el agente mantiene las dos afirmaciones separadas o se suma a la más cómoda.
¿Podemos probar el agente antes de que atienda llamadas reales?
Sí, y preferimos que lo haga. Ejecutamos provocaciones guionizadas contra nuestros propios agentes —interrupciones, premisas falsas, peticiones de hablar con una persona—, las evaluamos con una lista fija y publicamos lo que falla. Montaremos la misma prueba para su escenario durante la construcción. La demo de un proveedor le muestra al agente en su mejor día, que no es lo que necesitaba saber.
¿Se integra con nuestra telefonía y nuestro CRM?
El agente se sitúa en su línea telefónica y escribe en los sistemas que su equipo ya usa, y ambas conexiones forman parte de la construcción, no de un proyecto aparte. Lo que confirmamos por escrito antes de la primera llamada real es exactamente qué sistemas están conectados y qué se escribe dónde. Allí donde un sistema no pueda leerse y escribirse por programación, se lo decimos en el alcance en lugar de después.