Passer au contenu

Benchmarks

Performances AMD. Mesuré honnêtement.

Notre méthodologie de référence, les indicateurs que nous suivons, les langages que nous testons et les limites que nous reconnaissons sont clairement définis. Lorsque nous ne disposons pas de données mesurées sur un trafic similaire au vôtre, nous le précisons plutôt que d'en citer une.

Réponse rapide

Que mesurent les benchmarks DialerBee ? Ils mesurent la précision AMD : le modèle classe en temps réel la transcription des 3 premières secondes d’un appel comme provenant d’un interlocuteur humain ou d’un répondeur. Nous évaluons cette précision sur 11 langues, différents environnements d’opérateurs et types de campagnes. La vérité de référence provient des corrections apportées par les agents : un agent en désaccord avec une classification la signale en un clic. L’évaluation est continue et non un test ponctuel en laboratoire. Cinq indicateurs sont suivis : la précision, le taux de faux positifs, le taux de faux négatifs, la latence de détection et le taux de correction par les agents. Les chiffres publiés proviennent de projets pilotes internes et sont valables dans certaines conditions pilotes. Lorsque nous ne disposons pas de chiffres mesurés sur un trafic similaire au vôtre, nous le précisons plutôt que d’en citer.

Ce que nous comparons

Précision AMD à travers les langues

L'IA de DialerBee, AMD, utilise la classification de transcription des 3 premières secondes d'enregistrement audio pour déterminer si un humain ou un répondeur a décroché. Nous évaluons ce système sur plusieurs langues, environnements d'opérateurs et types de campagnes afin de mesurer sa précision en conditions réelles.

Contrairement aux fournisseurs qui font état d'une précision en conditions de laboratoire, nos indicateurs reflètent les données de production avec tous les aléas, la variabilité des opérateurs et les différences régionales inhérentes aux véritables campagnes sortantes.

Méthodologie

Comment nous précision de la mesure

Classification des transcriptions

Le modèle AMD effectue une transcription en temps réel des 3 premières secondes d'audio. Il lit les mots et les phrases, et non les formes d'onde audio ou les séquences de bips.

Remplacement de l'agent comme vérité de référence

Lorsque les agents sont en désaccord avec la classification AMD, ils le signalent d'un simple clic. Ces modifications servent de référence pour mesurer la précision.

Évaluation continue

Les tests de référence ne sont pas ponctuels. Nous évaluons en permanence la précision en fonction des modifications apportées par les agents sur l'ensemble des campagnes de production.

Indicateurs suivis

Cinq indicateurs cela compte

Précision

Taux global de classification correcte pour l'ensemble des appels.

Taux de faux positifs

Appels humains classés à tort comme appels de machines.

Taux de faux négatifs

Appels machine classés à tort comme humains.

Latence de détection

Délai entre la prise en charge de l'appel et la décision de classification AMD.

Taux de remplacement de l'agent

Pourcentage d'appels où les agents corrigent la décision AMD.

Résumé des données de référence

Résumé public des projets pilotes internes

Des chiffres détaillés par langue, par opérateur et par région issus de nos projets pilotes internes sont disponibles sur demande.

Métrique Résumé public Notes
Appels évalués Plage de 10 000 à 50 000 Dans le cadre des campagnes pilotes internes
Période couverte T1-T2 2026 Mise à jour au fur et à mesure que de nouvelles données pilotes sont disponibles
Langues testées 9 EN, AR, ES, FR, IT, DE, TR, HI, UR
Régions testées Moyen-Orient et Afrique du Nord, Europe, Amérique du Nord La composition des opérateurs varie selon la région
Types de campagne Recouvrement, externalisation des processus métier (BPO), ventes, assurances Résultats segmentés lorsque cela est possible
taux de faux positifs AMD Moins de 3 % dans certains projets pilotes Humain classé à tort comme machine
Taux de faux négatifs AMD Moins de 5 % dans certains projets pilotes Machine classée à tort comme humaine
Latence de détection médiane Moins d'une seconde Décision de prise en charge par AMD
latence de détection P90 Moins de 1,5 seconde Décision de prise en charge par AMD
taux de remplacement de l'agent Plage de 2 à 5 % Taux de correction manuelle dans les campagnes pilotes
Augmentation du taux de contact Jusqu'à 4 fois plus rapide que la numérotation manuelle Dans les flux de travail pilotes, les résultats varient
Réduction du temps d'inactivité Plage de 30 à 45 % Dans certaines campagnes pilotes

Basé sur des tests pilotes internes. Les résultats varient selon le type de campagne, la qualité des listes, l'opérateur, la région, la langue, la configuration du rythme et le flux de travail des agents. Le comportement par langue et par opérateur étant suffisamment variable, nous préférons effectuer des mesures sur vos itinéraires lors d'un test pilote plutôt que de publier une moyenne qui ne correspondrait pas à vos observations.

Langues testées

Onze langues, données réelles de pilotes

EN

Anglais

AR

arabe

ES

Espagnol

FR

Français

IT

italien

DE

Allemand

TR

turc

HI

hindi

UR

ourdou

Les données de référence pour l'arabe incluent les variantes dialectales du Golfe, du Levant et d'Égypte. Celles pour l'hindi et l'ourdou couvrent les variantes régionales. Chaque langue est évaluée indépendamment, avec des analyses détaillées par opérateur et par région.

Limites

Quels points de repère je ne peux pas vous le dire

Les résultats varient selon l'opérateur. Les messages d'accueil, la qualité audio et le temps de connexion diffèrent d'un opérateur à l'autre.

Les résultats varient selon le type de campagne. Les campagnes de recouvrement présentent des schémas de collecte différents de ceux des campagnes de vente ou d'enquête.

Les résultats varient selon les régions. Les styles de messages d'accueil des messageries vocales, l'infrastructure des opérateurs et les conditions du réseau diffèrent d'un marché à l'autre.

Les résultats varient selon la qualité de la liste. Les numéros obsolètes, erronés ou déconnectés affectent différemment les performances des appareils AMD.

Les indicateurs de performance reflètent les résultats globaux. Les résultats de chaque campagne peuvent être supérieurs ou inférieurs aux moyennes publiées.

Données de référence complètes du pilote interne sur demande

Des rapports d'évaluation interne, comprenant des tableaux de précision par langue, des analyses détaillées par opérateur et des données historiques sur les tendances, sont disponibles sous accord de confidentialité pour les prospects qualifiés. Contactez notre équipe pour en faire la demande.

Demander des données de référence

Réservez une démonstration et nous vous communiquerons des résultats détaillés des tests de performance AMD pertinents pour votre langue, votre région et votre type de campagne.

Voir le site complet en anglais →