Les démonstrations de Voice AI sont souvent convaincantes. Une conversation est transcrite en quelques secondes. Les intervenants sont séparés. Un résumé apparaît. Des signaux faibles sont extraits. L’effet est immédiat, et l’envie de déployer aussi.
Mais entre une démonstration réussie sur un enregistrement propre et un système réellement exploitable à l’échelle d’un centre de relation client, l’écart est important. Le sujet n’est pas seulement la transcription. Il est de transformer un flux vocal imparfait, bruité et parfois ambigu en information structurée, fiable et intégrable dans le SI.
Le speech-to-text n’est que la première couche
Une transcription correcte est nécessaire. Elle ne suffit pas.
Les moteurs actuels, Whisper, Azure Speech, Deepgram ou AssemblyAI, donnent des résultats impressionnants sur un enregistrement studio ou une conférence bien captée. Mais dans un centre d’appels, les conditions sont rarement idéales. Les enregistrements passent en téléphonie 8 kHz mono, avec de la compression, du bruit de fond, des accents régionaux, des chevauchements de parole, des coupures réseau et des termes métier absents du vocabulaire standard du modèle.
Un système qui affiche un taux d’erreur mot (WER) de 5 % sur un benchmark anglophone propre peut facilement monter à 15 ou 20 % sur des appels réels en français, avec accents et jargon sectoriel. Et sur certains segments critiques, un nom propre ou un numéro de contrat mal transcrit suffit à rendre le reste de la chaîne inutilisable.
Le premier travail consiste donc à mesurer la qualité de transcription dans vos conditions réelles, pas sur un jeu de démonstration fourni par l’éditeur.
La diarisation change tout
Sur beaucoup de cas d’usage, savoir “qui a dit quoi” est aussi important que le texte lui-même.
Prenons un cas concret : une analyse Voix du Client dans l’assurance. L’objectif est d’identifier les motifs d’insatisfaction exprimés par les assurés lors des appels au service sinistres. Sans diarisation robuste, le système peut attribuer au client une phrase prononcée par le conseiller, ou inversement. Une objection du client devient une reformulation du conseiller. Un engagement pris par l’opérateur disparaît dans le flux.
La diarisation est un problème notoirement difficile, surtout sur des enregistrements mono-canal. Les modèles spécialisés comme pyannote.audio ont beaucoup progressé, mais le taux d’erreur de diarisation (DER) reste sensible à la qualité audio, à la durée des tours de parole et aux moments de chevauchement. Sur des conversations courtes et nerveuses, comme un appel de réclamation, ces moments sont fréquents.
Ce n’est pas un détail technique. C’est une condition de qualité pour tous les usages en aval : classification des motifs, détection d’insatisfaction, évaluation qualité des conseillers.
Le vrai enjeu est de produire une structure exploitable
La valeur d’un système Voice AI ne vient pas de la transcription brute. Elle vient de la structure qu’on en tire.
Sur un programme Voix du Client dans les télécoms, l’objectif n’est pas d’avoir le texte intégral de 10 000 appels par mois. L’objectif est d’en extraire les motifs de contact récurrents, les irritants qui reviennent, les objections auxquelles les conseillers peinent à répondre, les engagements non tenus, et les signaux faibles d’attrition.
Cela suppose un travail de structuration qui va bien au-delà du speech-to-text : des taxonomies de motifs adaptées au métier, des règles de qualification claires, des cas d’usage bien bornés et des jeux d’évaluation permettant de mesurer la stabilité de la classification dans le temps. Un système qui détecte correctement le motif “problème de facturation” une semaine sur deux n’est pas exploitable, même si sa transcription est parfaite.
Autrement dit, le système doit transformer du son en éléments actionnables, pas seulement en texte.
L’intégration compte autant que le modèle
Un système Voice AI n’a d’intérêt que s’il peut s’inscrire dans le reste du SI. Si la sortie reste un résumé dans un fichier partagé ou un export CSV envoyé manuellement chaque semaine, le gain sera vite plafonné.
En pratique, l’intégration suppose de connecter le système :
- au CRM, pour relier chaque appel à un dossier client ;
- à l’outil qualité, pour alimenter les grilles d’évaluation ;
- à la base de tickets, pour corréler les motifs vocaux avec les réclamations écrites ;
- aux tableaux de bord, pour remonter les tendances aux managers.
Chaque connecteur ajoute un sujet de droits d’accès, de journalisation et de gestion des erreurs. Si le CRM est injoignable pendant deux heures, que fait le système ? Si un appel contient des données de santé, comment les isoler avant stockage ? L’architecture doit prévoir les connecteurs, mais aussi les mécanismes de reprise, les règles de conservation et la séparation entre environnements de test et de production.
Le sujet n’est pas seulement technique, il est aussi probatoire
Dès qu’on commence à utiliser la voix pour alimenter une décision, une évaluation qualité ou un traitement client, il faut clarifier le rôle exact du système dans la chaîne de décision.
Un système qui aide un superviseur à identifier les appels à réécouter en priorité n’a pas le même statut qu’un système qui note automatiquement la qualité d’un conseiller. Le premier est un outil d’assistance. Le second est un outil de décision, avec des implications en droit du travail et en dialogue social.
Beaucoup de dérives commencent quand un système d’aide est tacitement traité comme un système de décision. Le scoring qualité “indicatif” devient la base de l’évaluation annuelle. La détection d’insatisfaction “suggérée” devient le critère de rappel client. Sans cadrage explicite de ce que le système peut et ne peut pas décider seul, ces glissements sont presque inévitables.
Ce qu’il faut mesurer
Évaluer un système Voice AI demande plus qu’un taux de transcription global.
Il faut regarder en particulier :
- la qualité de transcription sur vos propres conditions audio, pas sur un benchmark standard ;
- la qualité de diarisation sur vos durées d’appel et vos profils de conversation réels ;
- la stabilité de la classification dans le temps, car un modèle peut dériver quand les motifs de contact évoluent ;
- le taux de cas ambigus, pour dimensionner correctement la revue humaine ;
- les erreurs qui coûtent le plus cher, identifiées et suivies spécifiquement.
Le bon système n’est pas celui qui impressionne sur un extrait choisi. C’est celui qui reste lisible, stable et utile quand le volume monte à plusieurs milliers d’appels par jour.
Conclusion
La Voice AI exploitable commence là où la simple transcription s’arrête. Le vrai sujet est la qualité de la structure produite, la robustesse de la diarisation, l’intégration métier et la clarté du rôle confié au système dans la chaîne de décision.
Cadre général : IA contrôlée, notre doctrine d’ingénierie de systèmes IA en environnement réel.
Distinguer ce qui relève de la démonstration de ce qui peut être industrialisé : développement logiciel et maintien en condition de confiance.