Ir para o conteúdo

Benchmarks

Desempenho AMD . Medido honestamente.

Nossa metodologia de avaliação comparativa, as métricas que monitoramos, os idiomas que testamos e as limitações que reconhecemos. Quando não temos um dado de tráfego semelhante ao seu, indicamos isso em vez de citar um exemplo.

O que usamos como referência

Precisão AMD em todos os idiomas

A IA AMD da DialerBee usa a classificação de transcrições nos primeiros 3 segundos do áudio da chamada para determinar se foi um humano ou uma secretária eletrônica que atendeu. Avaliamos o desempenho desse sistema em vários idiomas, ambientes de operadoras e tipos de campanha para medir a precisão em situações reais.

Ao contrário dos fornecedores que relatam precisão em condições de laboratório, nossos benchmarks refletem dados de produção com todo o ruído, variabilidade de operadoras e diferenças regionais que acompanham campanhas de marketing outbound reais.

Metodologia

Como nós precisão de medição

Classificação de transcrição

O modelo AMD classifica uma transcrição em tempo real dos primeiros 3 segundos de áudio. Ele lê palavras e frases, não formas de onda de áudio ou padrões de bipes.

Substituição do agente como verdade fundamental

Quando os agentes discordam da classificação AMD , eles a sinalizam com um clique. Essas alterações servem como rótulos de referência para medir a precisão.

Avaliação contínua

Os benchmarks não são testes pontuais. Avaliamos continuamente a precisão em relação ao fluxo de alterações feitas pelos agentes em todas as campanhas de produção.

Métricas monitoradas

Cinco métricas que importa

Precisão

Taxa geral de classificação correta em todas as chamadas.

Taxa de falsos positivos

Chamadas humanas classificadas incorretamente como chamadas de máquinas.

Taxa de falsos negativos

Chamadas de máquina classificadas incorretamente como humanas.

Latência de detecção

Tempo decorrido entre o atendimento da chamada e a decisão de classificação AMD .

Taxa de substituição do agente

Percentagem de chamadas em que os agentes corrigem a decisão AMD .

Resumo dos indicadores de desempenho

Resumo público dos pilotos internos

Dados detalhados por idioma, por operadora e por região, provenientes de nossos projetos-piloto internos, estão disponíveis mediante solicitação.

Métrica Resumo público Notas
Chamadas avaliadas intervalo de 10.000 a 50.000 Em campanhas piloto internas
Intervalo de datas 1º e 2º trimestres de 2026 Atualizado conforme novos dados do projeto piloto se tornam disponíveis.
Idiomas testados 9 EN, AR, ES, FR, IT, DE, TR, HI, UR
Regiões testadas Oriente Médio e Norte da África (MENA), Europa, América do Norte A composição das operadoras varia conforme a região.
Tipos de campanha Cobrança, BPO, vendas, seguros Resultados segmentados sempre que possível.
taxa de falsos positivos AMD Menos de 3% em pilotos selecionados Humano classificado incorretamente como máquina
taxa de falsos negativos AMD Menos de 5% em pilotos selecionados Máquina classificada incorretamente como humana
latência mediana de detecção Sub-1 segundo Decisão da AMD sobre a retirada
latência de detecção P90 Menos de 1,5 segundos Decisão da AMD sobre a retirada
Taxa de sobreposição do agente intervalo de 2 a 5% Taxa de correção manual em campanhas piloto
Elevação da taxa de contato Até 4 vezes mais rápido que a discagem manual. Em fluxos de trabalho piloto, os resultados variam.
Redução do tempo ocioso intervalo de 30–45% Em campanhas piloto selecionadas

Com base em benchmarks internos de projetos-piloto. Os resultados variam de acordo com o tipo de campanha, a qualidade da lista, a operadora, a região, o idioma, a configuração de ritmo e o fluxo de trabalho do agente. O comportamento por idioma e por operadora varia bastante, por isso preferimos medi-lo em suas rotas durante um projeto-piloto em vez de publicar uma média que não corresponda ao que você observará.

Idiomas testados

Onze línguas, dados reais de pilotos

EN

Inglês

AR

árabe

ES

Espanhol

FR

Francês

IT

italiano

DE

Alemão

TR

turco

HI

hindi

UR

urdu

Os benchmarks para o árabe incluem variantes dialetais do Golfo, do Levante e do Egito. Os benchmarks para o hindi e o urdu incluem a cobertura de variantes regionais. Cada idioma é avaliado individualmente, com detalhamentos específicos para cada operadora e região.

Limitações

Quais são os parâmetros de referência? não posso te dizer

Os resultados variam de acordo com a operadora. Diferentes operadoras produzem mensagens de voz, qualidade de áudio e tempo de conexão diferentes.

Os resultados variam conforme o tipo de campanha. Campanhas de cobrança apresentam padrões de coleta diferentes de campanhas de vendas ou pesquisas.

Os resultados variam conforme a região. Os estilos de saudação do correio de voz, a infraestrutura da operadora e as condições da rede diferem entre os mercados.

Os resultados variam de acordo com a qualidade da lista. Números desatualizados, números incorretos e linhas desconectadas afetam o desempenho AMD de maneiras diferentes.

Os indicadores refletem o desempenho agregado. Os resultados de campanhas individuais podem ser superiores ou inferiores às médias relatadas.

Dados completos de referência do projeto piloto interno disponíveis mediante solicitação.

Relatórios internos de benchmarking, com tabelas de precisão por idioma, detalhamentos específicos por operadora e dados históricos de tendências, estão disponíveis para candidatos qualificados mediante acordo de confidencialidade. Entre em contato com nossa equipe para solicitar acesso.

Solicitar dados de referência

Agende uma demonstração e compartilharemos resultados detalhados de benchmarks AMD relevantes para seu idioma, região e tipo de campanha.

Ver o site completo em inglês →