La plupart des affirmations sur les agents vocaux reposent sur une démo : un appelant scénarisé, un parcours idéal, un enregistrement choisi après coup. Une démo montre qu’un neuro-agent sait tenir une conversation. Le responsable d’une ligne commerciale a besoin d’une seconde réponse : l’agent vend-il aussi bien que les personnes qui répondent déjà au téléphone chez vous ?
Seule une comparaison sur du trafic réel donne cette réponse. Elle est plus difficile à monter qu’une démo et peut mettre l’un ou l’autre camp dans l’embarras : c’est précisément pour cela qu’elle vaut la peine d’être menée.
Une méthode pour votre propre test
Cet article explique comment mener la comparaison et comment la lire. Il ne rapporte aucun taux de conversion, aucun effectif ni aucun coût issu de l’un de nos comptes, parce qu’un chiffre tiré d’une ligne, d’un produit et d’un marché vous apprendrait peu de chose sur les vôtres. Les seuls chiffres qui suivent sont ceux de Gartner, chacun avec son année.
Ce qu'est le taux de validation, et pourquoi c'est une mesure brutale
Le taux de validation, ce sont les commandes confirmées sur les appels traités. Pas des leads, pas de l'intérêt, pas un rappel accepté : une commande que le client a réellement confirmée pendant cet appel. C'est le chiffre le moins indulgent de la vente directe par téléphone, parce qu'une mauvaise conversation n'a nulle part où se cacher. Un appel finit par une commande ou non.
Il comporte aussi un seuil plancher incompressible. Sous un certain taux de validation, la dépense média qui a généré l’appel ne se rembourse pas : repérez donc où se situe ce seuil sur votre propre compte avant de lancer le test. Confrontez le résultat à ce chiffre : l’agent réussit le test s’il franchit la ligne où le compte cesse de perdre de l’argent.
Commencez par une période de calibrage
Attendez-vous à ce que les premières semaines sur du trafic réel ressemblent à du calibrage, parce que c’en est. L’agent traite de vrais appelants, se trompe, et chaque appel raté est réinjecté la même semaine dans le script et le traitement des objections.
Jugez-le une fois cette période terminée. Ce qui fait progresser un agent pendant ses premières semaines, ce sont les transcriptions : ce que les clients de ce produit précis demandent réellement, et les objections que personne n’avait notées avant le lancement. Évaluer ces semaines-là face à un plateau qui vend le produit depuis des années revient à comparer une nouvelle recrue avec les anciens.
Les semaines de calibrage sont celles où le script rencontre les questions que personne n’avait notées.
Une fois le calibrage terminé, mettez les deux chiffres côte à côte pour les mêmes semaines : le taux de validation de l’agent et celui du plateau, sur les mêmes offres et le même trafic. Un autre mois, un autre mix d’offres ou un pilote sur les appels restants change les conditions, et le résultat mesure alors ces conditions.
Lisez le résultat honnêtement
Quel que soit le camp que la moyenne favorise, ne vous arrêtez pas là. Une moyenne de plateau mélange vos meilleurs éléments et les plus faibles, et la question utile est de savoir auquel d’entre eux l’agent ressemble quand il vend. Quiconque vous promet qu’un agent vocal vendra mieux que vos meilleurs opérateurs promet quelque chose que seul votre propre test peut montrer.
Où il se situe parmi vos propres opérateurs
Une moyenne de plateau cache l’essentiel, parce qu’un même plateau réunit des personnes qui vendent très différemment. Répartissez vos propres opérateurs selon leur vraie capacité à vendre, sur les mêmes offres et les mêmes semaines, et la comparaison commence à avoir un sens :
- Les maîtres, le haut du plateau. Si l’agent les égale, le dossier économique se défend tout seul : vérifiez donc ce résultat deux fois avant d’y croire.
- Le niveau intermédiaire, en général le gros du plateau. Se situer dans cette tranche est un vrai résultat, parce que c’est là que la plupart de vos appels sont traités.
- Les opérateurs faibles. La tranche que l’agent doit dépasser avant de prendre des appels auxquels vos équipes auraient répondu ; en dessous, ces appels perdent des commandes qu’une personne aurait prises.
- Les débutants, qui apprennent encore le produit. Une comparaison avec eux flatte n’importe qui.
- L’agent. Placez-le sur cette échelle offre par offre, parce qu’une offre nouvelle et une offre mûre peuvent le situer dans des tranches différentes.
Cette description est moins enthousiasmante que la plupart des slides de fournisseurs, et beaucoup plus utile pour planifier, parce que l’essentiel d’un plateau se trouve dans la tranche intermédiaire. Un agent qui vend comme cette tranche à chaque service, à toute heure, est une base de planification.
Ce que le chiffre de conversion ne montre pas
La conversion n’est que la moitié de la comparaison. L’autre moitié, c’est le nombre d’appels que chaque camp peut prendre à mesure qu’ils arrivent. Un plateau a un nombre fixe de postes à une heure donnée ; un agent prend les appels simultanés dès qu’ils arrivent, jusqu’à la capacité convenue pour la ligne. Suivez les appels traités à côté du taux de validation, par offre et par heure, sinon le test passera à côté de la moitié où les deux diffèrent le plus.
Le trafic généré par les médias le montre bien. Les appels déclenchés par un spot télé ou radio n’arrivent pas régulièrement. Ils arrivent en pic, quand le spot passe à l’antenne, et un plateau dimensionné pour le pic reste inoccupé le reste de la journée, tandis qu’un plateau dimensionné pour la moyenne laisse tomber le pic.
Le plateau ne perd pas le pic parce qu'il vend mal. Il perd le pic parce qu'il est fini.
Où passe réellement le mois d'un opérateur
Avant de comparer les coûts, regardez ce que contient une heure payée sur le plateau. Prenez un mois de votre propre reporting d’effectifs et répartissez le temps payé entre :
- L’attente, sans appel.
- Le temps réellement passé en conversation avec un client.
- Les pauses et le repos.
- La formation.
- Le travail après appel.
La conversation n’est qu’une ligne de cette liste, et sur un plateau dimensionné pour un pic que personne ne peut prévoir, c’est l’attente qui grossit. C’est l’arithmétique d’un effectif dimensionné pour un pic, quelle que soit l’équipe en place. Gartner estimait en 2022 que la part du travail humain dans le coût d’un centre de contact pouvait atteindre 95 %, si bien qu’une heure passée à attendre le téléphone est presque entièrement du coût, sans chiffre d’affaires en face.
Pourquoi nous ne publions pas de ratio de coût
Un ratio de coût entre un agent et un opérateur est construit sur des salaires locaux, et tout ratio que nous publierions ferait entrer la masse salariale de quelqu’un d’autre dans votre dossier économique. Les propres chiffres de Gartner pour 2025 situent un contact en libre-service à 1,84 dollar contre 13,50 dollars pour un contact assisté, soit environ sept pour un ; prenez cela comme la forme et votre propre masse salariale comme le chiffre.
Où le test s’applique, et où il ne s’applique pas
Un test sur trafic partagé vous dit ce qui se passe sur votre ligne, avec vos offres et vos clients, et rien de plus. Les appels transactionnels courts sont proches du cas le plus facile pour l’automatisation : peu de questions, et une décision prise pendant l’appel. Un achat réfléchi, une ligne B2B ou toute vente où le client a besoin d’une semaine pour décider appelle un test à part, et un résultat obtenu sur l’un ne se transpose pas à l’autre.
Le test n’est pas non plus un plan d’effectifs. Une enquête Gartner de 2025 a constaté que seules 20 % des organisations de service réduisent effectivement leurs effectifs après avoir déployé de l’IA. Là où un agent se rentabilise, regardez d’abord les appels que le plateau laissait tomber au moment du pic : ils se voient dans le chiffre d’affaires.
Comment mener le test
- Répartissez du trafic réel, ne faites pas tourner un pilote à côté de la réalité. La seule comparaison qui vaille, ce sont les mêmes offres, les mêmes heures, les mêmes clients.
- Accordez-lui une période de calibrage et attendez-vous à de la médiocrité. Réinjectez chaque appel raté dans le script, et n’évaluez pas l’agent avant la fin de cette période.
- Mesurez l'indicateur sur lequel le compte est réellement jugé. Le taux de validation est désagréable précisément parce qu'on ne peut pas le truquer avec un ton plus chaleureux.
- Orientez-le d’abord vers le pic. C’est là que votre plateau perd des appels qu’il ne verra jamais, et là que la capacité compte le plus.
- Comparez-le à vos tranches, pas à votre moyenne. S'il se situe au-dessus de votre tranche faible, c'est un vrai résultat, et votre moyenne n'a de toute façon jamais été une personne.
La question qui mérite une réponse est plus étroite que celle des slides de la plupart des fournisseurs : sur vos propres appels, auquel de vos opérateurs l’agent ressemble-t-il quand il vend, et que deviennent les appels que personne sur le plateau n’était libre de prendre ?