Vai al contenuto

Benchmark

Prestazioni AMD. Misurato onestamente.

La nostra metodologia di benchmarking, le metriche che monitoriamo, le lingue che testiamo e i limiti che riconosciamo. Laddove non disponiamo di un dato misurato su un traffico simile al vostro, lo specifichiamo anziché citarne uno.

Risposta rapida

Cosa misurano i benchmark DialerBee? Misurano l'accuratezza AMD dell'IA: il modello classifica una trascrizione in tempo reale dei primi 3 secondi di audio di una chiamata come se si tratti di una persona reale o di una segreteria telefonica, e noi confrontiamo questo valore in 11 lingue, ambienti di operatori e tipologie di campagne. I dati di riferimento provengono dalle segnalazioni degli operatori, che indicano che un operatore che non concorda con una classificazione la segnala con un clic. La valutazione è continua, non si tratta di un test di laboratorio una tantum. Vengono monitorate cinque metriche: accuratezza, tasso di falsi positivi, tasso di falsi negativi, latenza di rilevamento e tasso di segnalazione degli operatori. I dati pubblicati provengono da progetti pilota interni e sono validi in condizioni pilota selezionate; laddove non disponiamo di un dato misurato su un traffico simile al vostro, lo specifichiamo anziché citarne uno.

Cosa utilizziamo come parametro di riferimento

Precisione AMD attraverso le lingue

Il sistema di intelligenza artificiale AMD di DialerBee utilizza la classificazione delle trascrizioni dei primi 3 secondi di audio della chiamata per determinare se a rispondere è stato un essere umano o una segreteria telefonica. Testiamo le prestazioni di questo sistema in diverse lingue, ambienti di operatori telefonici e tipologie di campagne per misurarne l'accuratezza nel mondo reale.

A differenza dei fornitori che dichiarano un'accuratezza basata su test di laboratorio, i nostri parametri di riferimento riflettono i dati di produzione, con tutte le variabili, le differenze tra i vari operatori e le differenze regionali che caratterizzano le campagne di chiamate in uscita reali.

Metodologia

Come noi misurare la precisione

Classificazione della trascrizione

Il modello AMD classifica una trascrizione in tempo reale dei primi 3 secondi di audio. Legge parole e frasi, non forme d'onda audio o sequenze di segnali acustici.

Sovrascrittura dell'agente come verità di base

Quando gli agenti non concordano con la classificazione AMD, la segnalano con un clic. Queste modifiche fungono da etichette di riferimento per la misurazione dell'accuratezza.

Valutazione continua

I benchmark non sono test una tantum. Valutiamo continuamente l'accuratezza rispetto al flusso di override degli agenti in tutte le campagne di produzione.

Metriche monitorate

Cinque parametri che contano

Precisione

Tasso complessivo di classificazione corretta su tutte le chiamate.

Tasso di falsi positivi

Chiamate umane classificate erroneamente come chiamate automatiche.

Tasso di falsi negativi

Le chiamate automatiche vengono erroneamente classificate come chiamate umane.

Latenza di rilevamento

Tempo intercorso tra la risposta alla chiamata e la decisione di classificazione AMD.

Tasso di override dell'agente

Percentuale di chiamate in cui gli operatori correggono la decisione di AMD.

Riepilogo del benchmark

Riassunto pubblico dei progetti pilota interni

Su richiesta sono disponibili dati dettagliati per lingua, operatore e regione, derivanti dai nostri progetti pilota interni.

metrico Sintesi pubblica Note
Chiamate valutate intervallo 10.000–50.000 Attraverso campagne pilota interne
Intervallo di date Primo-secondo trimestre 2026 Aggiornato non appena saranno disponibili nuovi dati pilota.
Lingue testate 9 EN, AR, ES, FR, IT, DE, TR, HI, UR
Regioni testate Medio Oriente e Nord Africa, Europa, Nord America La composizione degli operatori varia a seconda della regione.
Tipi di campagna Recupero crediti, BPO, vendite, assicurazioni Risultati segmentati ove possibile
Tasso di falsi positivi AMD Meno del 3% nei piloti selezionati Un essere umano classificato erroneamente come macchina.
Tasso di falsi negativi AMD Meno del 5% nei piloti selezionati Macchina classificata erroneamente come essere umano
Latenza di rilevamento mediana Meno di un secondo Decisione sul pickup per AMD
Latenza di rilevamento P90 In meno di 1,5 secondi Decisione sul pickup per AMD
Tasso di override dell'agente intervallo 2–5% Tasso di correzione manuale nelle campagne pilota
aumento del tasso di contatto Fino a 4 volte più veloce rispetto alla composizione manuale Nei flussi di lavoro pilota, i risultati variano
riduzione dei tempi di inattività intervallo 30-45% In campagne pilota selezionate

Basato su benchmark interni di progetti pilota. I risultati variano in base al tipo di campagna, alla qualità della lista, all'operatore, alla regione, alla lingua, alla configurazione del ritmo e al flusso di lavoro dell'agente. Il comportamento per lingua e per operatore varia a tal punto che preferiamo misurarlo sui vostri percorsi durante un progetto pilota piuttosto che pubblicare una media che non corrisponderà ai risultati che osserverete.

Lingue testate

Undici lingue, dati reali del pilota

EN

Inglese

AR

arabo

ES

spagnolo

FR

francese

IT

Italiano

DE

tedesco

TR

turco

HI

hindi

UR

Urdu

I parametri di riferimento per l'arabo includono le varianti dialettali del Golfo, del Levante e dell'Egitto. I parametri di riferimento per l'hindi e l'urdu includono la copertura delle varianti regionali. Ogni lingua viene analizzata in modo indipendente, con suddivisioni specifiche per operatore e per regione.

Limitazioni

Quali parametri di riferimento non posso dirtelo

I risultati variano a seconda dell'operatore. Operatori diversi offrono messaggi di benvenuto della segreteria telefonica, qualità audio e tempi di connessione differenti.

I risultati variano a seconda del tipo di campagna. Le campagne di raccolta fondi presentano modelli di ritiro diversi rispetto alle campagne di vendita o ai sondaggi.

I risultati variano a seconda della regione. Gli stili dei messaggi di benvenuto della segreteria telefonica, l'infrastruttura dell'operatore e le condizioni di rete differiscono da mercato a mercato.

I risultati variano in base alla qualità dell'elenco. Numeri obsoleti, numeri errati e linee disconnesse influiscono in modo diverso sulle prestazioni di AMD.

I parametri di riferimento riflettono le prestazioni aggregate. I risultati delle singole campagne possono essere superiori o inferiori alle medie riportate.

Dati completi di riferimento per il pilota interno disponibili su richiesta.

Sono disponibili, previo accordo di riservatezza (NDA), report di benchmarking interni sui piloti, con tabelle di accuratezza per lingua, suddivisioni specifiche per operatore e dati storici sulle tendenze. Contattate il nostro team per richiedere l'accesso.

Richiedi dati di riferimento

Prenota una demo e ti mostreremo i risultati dettagliati dei benchmark AMD, pertinenti alla tua lingua, regione e tipo di campagna.

Visualizza il sito completo in inglese →