Benchmarks
Desempenho AMD . Medido honestamente.
Nossa metodologia de avaliação comparativa, as métricas que monitoramos, os idiomas que testamos e as limitações que reconhecemos. Quando não temos um dado de tráfego semelhante ao seu, indicamos isso em vez de citar um exemplo.
O que usamos como referência
Precisão AMD em todos os idiomas
A IA AMD da DialerBee usa a classificação de transcrições nos primeiros 3 segundos do áudio da chamada para determinar se foi um humano ou uma secretária eletrônica que atendeu. Avaliamos o desempenho desse sistema em vários idiomas, ambientes de operadoras e tipos de campanha para medir a precisão em situações reais.
Ao contrário dos fornecedores que relatam precisão em condições de laboratório, nossos benchmarks refletem dados de produção com todo o ruído, variabilidade de operadoras e diferenças regionais que acompanham campanhas de marketing outbound reais.
Metodologia
Como nós precisão de medição
Classificação de transcrição
O modelo AMD classifica uma transcrição em tempo real dos primeiros 3 segundos de áudio. Ele lê palavras e frases, não formas de onda de áudio ou padrões de bipes.
Substituição do agente como verdade fundamental
Quando os agentes discordam da classificação AMD , eles a sinalizam com um clique. Essas alterações servem como rótulos de referência para medir a precisão.
Avaliação contínua
Os benchmarks não são testes pontuais. Avaliamos continuamente a precisão em relação ao fluxo de alterações feitas pelos agentes em todas as campanhas de produção.
Métricas monitoradas
Cinco métricas que importa
Precisão
Taxa geral de classificação correta em todas as chamadas.
Taxa de falsos positivos
Chamadas humanas classificadas incorretamente como chamadas de máquinas.
Taxa de falsos negativos
Chamadas de máquina classificadas incorretamente como humanas.
Latência de detecção
Tempo decorrido entre o atendimento da chamada e a decisão de classificação AMD .
Taxa de substituição do agente
Percentagem de chamadas em que os agentes corrigem a decisão AMD .
Resumo dos indicadores de desempenho
Resumo público dos pilotos internos
Dados detalhados por idioma, por operadora e por região, provenientes de nossos projetos-piloto internos, estão disponíveis mediante solicitação.
| Métrica | Resumo público | Notas |
|---|---|---|
| Chamadas avaliadas | intervalo de 10.000 a 50.000 | Em campanhas piloto internas |
| Intervalo de datas | 1º e 2º trimestres de 2026 | Atualizado conforme novos dados do projeto piloto se tornam disponíveis. |
| Idiomas testados | 9 | EN, AR, ES, FR, IT, DE, TR, HI, UR |
| Regiões testadas | Oriente Médio e Norte da África (MENA), Europa, América do Norte | A composição das operadoras varia conforme a região. |
| Tipos de campanha | Cobrança, BPO, vendas, seguros | Resultados segmentados sempre que possível. |
| taxa de falsos positivos AMD | Menos de 3% em pilotos selecionados | Humano classificado incorretamente como máquina |
| taxa de falsos negativos AMD | Menos de 5% em pilotos selecionados | Máquina classificada incorretamente como humana |
| latência mediana de detecção | Sub-1 segundo | Decisão da AMD sobre a retirada |
| latência de detecção P90 | Menos de 1,5 segundos | Decisão da AMD sobre a retirada |
| Taxa de sobreposição do agente | intervalo de 2 a 5% | Taxa de correção manual em campanhas piloto |
| Elevação da taxa de contato | Até 4 vezes mais rápido que a discagem manual. | Em fluxos de trabalho piloto, os resultados variam. |
| Redução do tempo ocioso | intervalo de 30–45% | Em campanhas piloto selecionadas |
Com base em benchmarks internos de projetos-piloto. Os resultados variam de acordo com o tipo de campanha, a qualidade da lista, a operadora, a região, o idioma, a configuração de ritmo e o fluxo de trabalho do agente. O comportamento por idioma e por operadora varia bastante, por isso preferimos medi-lo em suas rotas durante um projeto-piloto em vez de publicar uma média que não corresponda ao que você observará.
Idiomas testados
Onze línguas, dados reais de pilotos
EN
Inglês
AR
árabe
ES
Espanhol
FR
Francês
IT
italiano
DE
Alemão
TR
turco
HI
hindi
UR
urdu
Os benchmarks para o árabe incluem variantes dialetais do Golfo, do Levante e do Egito. Os benchmarks para o hindi e o urdu incluem a cobertura de variantes regionais. Cada idioma é avaliado individualmente, com detalhamentos específicos para cada operadora e região.
Limitações
Quais são os parâmetros de referência? não posso te dizer
Os resultados variam de acordo com a operadora. Diferentes operadoras produzem mensagens de voz, qualidade de áudio e tempo de conexão diferentes.
Os resultados variam conforme o tipo de campanha. Campanhas de cobrança apresentam padrões de coleta diferentes de campanhas de vendas ou pesquisas.
Os resultados variam conforme a região. Os estilos de saudação do correio de voz, a infraestrutura da operadora e as condições da rede diferem entre os mercados.
Os resultados variam de acordo com a qualidade da lista. Números desatualizados, números incorretos e linhas desconectadas afetam o desempenho AMD de maneiras diferentes.
Os indicadores refletem o desempenho agregado. Os resultados de campanhas individuais podem ser superiores ou inferiores às médias relatadas.
Dados completos de referência do projeto piloto interno disponíveis mediante solicitação.
Relatórios internos de benchmarking, com tabelas de precisão por idioma, detalhamentos específicos por operadora e dados históricos de tendências, estão disponíveis para candidatos qualificados mediante acordo de confidencialidade. Entre em contato com nossa equipe para solicitar acesso.
Solicitar dados de referência
Agende uma demonstração e compartilharemos resultados detalhados de benchmarks AMD relevantes para seu idioma, região e tipo de campanha.