La reconnaissance vocale, la compréhension et la synthèse tournent sur nos propres serveurs, et vos données d'appel restent dans votre région. L'agent répond en 0,3 seconde environ, si bien que votre client n'attend jamais — et quand il lui coupe la parole, la plateforme enregistre quelle part de la réponse il a réellement entendue.
Personne ne remarque une bonne voix. On remarque un blanc. Une pause avant la réponse est le moyen le plus rapide pour un appelant de comprendre qu'il n'y a personne.
du moment où l'appelant se tait à celui où l'agent commence
Chaque réponse suit trois étapes : entendre la fin du tour de parole de l'appelant, décider quoi dire, puis commencer à le dire. Chacune consomme des millisecondes, et l'appelant ne perçoit que le total. C'est parce que nous exploitons toute la chaîne nous-mêmes que ce total reste maîtrisable — il n'y a pas de file d'attente sur l'API d'un tiers au milieu de la phrase.
L'agent commence aussi à parler avant d'avoir fini de composer, comme le fait une personne, si bien que le premier mot arrive pendant que le reste se produit encore.
S'arrêter quand l'appelant parle est la partie facile. La partie difficile consiste à savoir quel morceau de votre phrase il n'a jamais entendu, et à en faire quelque chose.
Lors d'un test de résistance enregistré sur l'un de nos propres agents de démonstration, un testeur lui a coupé la parole quatre fois. À la première interruption, la plateforme a consigné que l'appelant avait entendu 76 des 159 caractères que l'agent était en train de prononcer — 47 % de la réponse. Comme l'information clé se trouvait dans la moitié non entendue, le système a annulé son propre passage à l'étape suivante, a redit la substance, et n'est revenu qu'ensuite à sa question.
Les trois autres interruptions sont tombées à 0 % entendu. L'agent a accusé réception, a répété la question restée en suspens et a poursuivi, sans parler par-dessus l'appelant et sans perdre sa place.
Le test de résistance complet, y compris le point que nous avons perdu →Deux modes de défaillance expliquent la plupart des appels qui tournent visiblement mal. Les deux méritent d'être testés avant d'acheter.
Un robot piloté par script recommence l'étape. L'agent revient à la question qu'il avait réellement posée, les réponses déjà recueillies restant en place, si bien que l'appelant n'est jamais ramené au début.
Invité à confirmer quelque chose qui n'est pas dans la base de connaissances, un modèle sous pression sociale acceptera souvent, par serviabilité. Le nôtre est conçu pour garder deux propositions distinctes plutôt que de les fondre en une réponse commode, et pour transférer là où un fait manque.
Comment nous bridons l'invention →“Je suis un assistant numérique” est honnête et, en soi, une impasse. Le scénario porte une sortie explicite — une proposition de rappel ou un transfert — parce qu'un appelant qui demande un humain et à qui on ne donne rien raccroche, tout simplement.
La reconnaissance, la compréhension et la synthèse sont les nôtres, dans une seule chaîne. C'est à la fois une décision de latence et une décision sur les données.
Synthèse vocale, reconnaissance vocale et modèle de langage — les trois composants dont tout agent vocal a besoin, qui fonctionnent ensemble au lieu d'être assemblés entre plusieurs fournisseurs.
Les trois tournent sur nos propres serveurs : l'audio de vos appels, les transcriptions et les données de vos clients restent dans votre région et ne passent par aucun service tiers. Si vous avez une raison de préférer un fournisseur précis pour un composant, nous pouvons l'intégrer — et nous vous indiquons par écrit quels composants sont les nôtres et lesquels ne le sont pas avant que l'agent prenne un appel réel.
Où vos données sont traitées, et ce que nous ne prétendons pas →Rien de tout cela n'apparaît dans une démo. Tout cela apparaît dans vos journaux d'appels.
Un message d'accueil de répondeur ressemble à une personne qui décroche, et un argumentaire délivré à un répondeur est du pur gaspillage. L'agent fait la différence et traite une machine comme une machine.
Comment fonctionne la détection →Adresses, orthographes, dates et numéros sont relus et confirmés pendant l'appel, parce qu'une livraison à la mauvaise adresse coûte plus cher que l'appel.
Locator examine 100 % des conversations selon une grille convenue avec vous. Un service qualité humain en atteint 3–5 %, chiffre qui vient de notre propre exploitation d'opérations d'appels réelles.
Ce que produit la notation des appels →