Benchmarks
Performances AMD. Mesuré honnêtement.
Notre méthodologie de référence, les indicateurs que nous suivons, les langages que nous testons et les limites que nous reconnaissons sont clairement définis. Lorsque nous ne disposons pas de données mesurées sur un trafic similaire au vôtre, nous le précisons plutôt que d'en citer une.
Réponse rapide
Que mesurent les benchmarks DialerBee ? Ils mesurent la précision AMD : le modèle classe en temps réel la transcription des 3 premières secondes d’un appel comme provenant d’un interlocuteur humain ou d’un répondeur. Nous évaluons cette précision sur 11 langues, différents environnements d’opérateurs et types de campagnes. La vérité de référence provient des corrections apportées par les agents : un agent en désaccord avec une classification la signale en un clic. L’évaluation est continue et non un test ponctuel en laboratoire. Cinq indicateurs sont suivis : la précision, le taux de faux positifs, le taux de faux négatifs, la latence de détection et le taux de correction par les agents. Les chiffres publiés proviennent de projets pilotes internes et sont valables dans certaines conditions pilotes. Lorsque nous ne disposons pas de chiffres mesurés sur un trafic similaire au vôtre, nous le précisons plutôt que d’en citer.
Ce que nous comparons
Précision AMD à travers les langues
L'IA de DialerBee, AMD, utilise la classification de transcription des 3 premières secondes d'enregistrement audio pour déterminer si un humain ou un répondeur a décroché. Nous évaluons ce système sur plusieurs langues, environnements d'opérateurs et types de campagnes afin de mesurer sa précision en conditions réelles.
Contrairement aux fournisseurs qui font état d'une précision en conditions de laboratoire, nos indicateurs reflètent les données de production avec tous les aléas, la variabilité des opérateurs et les différences régionales inhérentes aux véritables campagnes sortantes.
Méthodologie
Comment nous précision de la mesure
Classification des transcriptions
Le modèle AMD effectue une transcription en temps réel des 3 premières secondes d'audio. Il lit les mots et les phrases, et non les formes d'onde audio ou les séquences de bips.
Remplacement de l'agent comme vérité de référence
Lorsque les agents sont en désaccord avec la classification AMD, ils le signalent d'un simple clic. Ces modifications servent de référence pour mesurer la précision.
Évaluation continue
Les tests de référence ne sont pas ponctuels. Nous évaluons en permanence la précision en fonction des modifications apportées par les agents sur l'ensemble des campagnes de production.
Indicateurs suivis
Cinq indicateurs cela compte
Précision
Taux global de classification correcte pour l'ensemble des appels.
Taux de faux positifs
Appels humains classés à tort comme appels de machines.
Taux de faux négatifs
Appels machine classés à tort comme humains.
Latence de détection
Délai entre la prise en charge de l'appel et la décision de classification AMD.
Taux de remplacement de l'agent
Pourcentage d'appels où les agents corrigent la décision AMD.
Résumé des données de référence
Résumé public des projets pilotes internes
Des chiffres détaillés par langue, par opérateur et par région issus de nos projets pilotes internes sont disponibles sur demande.
| Métrique | Résumé public | Notes |
|---|---|---|
| Appels évalués | Plage de 10 000 à 50 000 | Dans le cadre des campagnes pilotes internes |
| Période couverte | T1-T2 2026 | Mise à jour au fur et à mesure que de nouvelles données pilotes sont disponibles |
| Langues testées | 9 | EN, AR, ES, FR, IT, DE, TR, HI, UR |
| Régions testées | Moyen-Orient et Afrique du Nord, Europe, Amérique du Nord | La composition des opérateurs varie selon la région |
| Types de campagne | Recouvrement, externalisation des processus métier (BPO), ventes, assurances | Résultats segmentés lorsque cela est possible |
| taux de faux positifs AMD | Moins de 3 % dans certains projets pilotes | Humain classé à tort comme machine |
| Taux de faux négatifs AMD | Moins de 5 % dans certains projets pilotes | Machine classée à tort comme humaine |
| Latence de détection médiane | Moins d'une seconde | Décision de prise en charge par AMD |
| latence de détection P90 | Moins de 1,5 seconde | Décision de prise en charge par AMD |
| taux de remplacement de l'agent | Plage de 2 à 5 % | Taux de correction manuelle dans les campagnes pilotes |
| Augmentation du taux de contact | Jusqu'à 4 fois plus rapide que la numérotation manuelle | Dans les flux de travail pilotes, les résultats varient |
| Réduction du temps d'inactivité | Plage de 30 à 45 % | Dans certaines campagnes pilotes |
Basé sur des tests pilotes internes. Les résultats varient selon le type de campagne, la qualité des listes, l'opérateur, la région, la langue, la configuration du rythme et le flux de travail des agents. Le comportement par langue et par opérateur étant suffisamment variable, nous préférons effectuer des mesures sur vos itinéraires lors d'un test pilote plutôt que de publier une moyenne qui ne correspondrait pas à vos observations.
Langues testées
Onze langues, données réelles de pilotes
EN
Anglais
AR
arabe
ES
Espagnol
FR
Français
IT
italien
DE
Allemand
TR
turc
HI
hindi
UR
ourdou
Les données de référence pour l'arabe incluent les variantes dialectales du Golfe, du Levant et d'Égypte. Celles pour l'hindi et l'ourdou couvrent les variantes régionales. Chaque langue est évaluée indépendamment, avec des analyses détaillées par opérateur et par région.
Limites
Quels points de repère je ne peux pas vous le dire
Les résultats varient selon l'opérateur. Les messages d'accueil, la qualité audio et le temps de connexion diffèrent d'un opérateur à l'autre.
Les résultats varient selon le type de campagne. Les campagnes de recouvrement présentent des schémas de collecte différents de ceux des campagnes de vente ou d'enquête.
Les résultats varient selon les régions. Les styles de messages d'accueil des messageries vocales, l'infrastructure des opérateurs et les conditions du réseau diffèrent d'un marché à l'autre.
Les résultats varient selon la qualité de la liste. Les numéros obsolètes, erronés ou déconnectés affectent différemment les performances des appareils AMD.
Les indicateurs de performance reflètent les résultats globaux. Les résultats de chaque campagne peuvent être supérieurs ou inférieurs aux moyennes publiées.
Données de référence complètes du pilote interne sur demande
Des rapports d'évaluation interne, comprenant des tableaux de précision par langue, des analyses détaillées par opérateur et des données historiques sur les tendances, sont disponibles sous accord de confidentialité pour les prospects qualifiés. Contactez notre équipe pour en faire la demande.
Demander des données de référence
Réservez une démonstration et nous vous communiquerons des résultats détaillés des tests de performance AMD pertinents pour votre langue, votre région et votre type de campagne.