Benchmarks
Rendimiento de AMD. Medido con honestidad.
Nuestra metodología de evaluación comparativa, las métricas que monitorizamos, los idiomas que analizamos y las limitaciones que reconocemos. Cuando no disponemos de datos para un tráfico similar al suyo, lo indicamos en lugar de citar una cifra.
Respuesta rápida
¿Qué miden las pruebas DialerBee? Miden la precisión de la IA AMD: el modelo clasifica una transcripción en tiempo real de los primeros 3 segundos de audio de una llamada como una persona real o un contestador automático, y realizamos pruebas comparativas en 11 idiomas, entornos de operadores y tipos de campañas. La verdad fundamental proviene de las anulaciones de los agentes, donde un agente que no está de acuerdo con una clasificación la marca con un solo clic, y la evaluación es continua en lugar de una prueba de laboratorio única. Se realiza un seguimiento de cinco métricas: precisión, tasa de falsos positivos, tasa de falsos negativos, latencia de detección y tasa de anulación de agentes. Las cifras publicadas provienen de pruebas piloto internas y se mantienen en condiciones de prueba seleccionadas; cuando no tenemos una cifra medida en tráfico como el suyo, lo indicamos en lugar de citarla.
Lo que evaluamos
Precisión de AMD en todos los idiomas
La IA AMD de DialerBee utiliza la clasificación de transcripciones de los primeros 3 segundos del audio de la llamada para determinar si la contestó una persona o un contestador automático. Evaluamos este sistema en varios idiomas, entornos de operadores y tipos de campañas para medir su precisión en situaciones reales.
A diferencia de los proveedores que informan sobre la precisión en condiciones de laboratorio, nuestros puntos de referencia reflejan datos de producción con todo el ruido, la variabilidad de los operadores y las diferencias regionales que conllevan las campañas salientes reales.
Metodología
Cómo lo hacemos precisión de la medición
Clasificación de transcripciones
El modelo AMD clasifica una transcripción en tiempo real de los primeros 3 segundos de audio. Lee palabras y frases, no formas de onda de audio ni patrones de pitidos.
Anulación del agente como verdad fundamental
Cuando los agentes no están de acuerdo con la clasificación AMD, la marcan con un solo clic. Estas anulaciones sirven como etiquetas de referencia para medir la precisión.
Evaluación continua
Los puntos de referencia no son pruebas puntuales. Evaluamos continuamente la precisión comparándola con el flujo de anulaciones de agentes en todas las campañas de producción.
Métricas rastreadas
Cinco métricas ese asunto
Exactitud
Tasa de clasificación correcta general en todas las llamadas.
Tasa de falsos positivos
Llamadas humanas clasificadas erróneamente como realizadas por máquinas.
Tasa de falsos negativos
Llamadas de máquinas clasificadas erróneamente como humanas.
Latencia de detección
Tiempo transcurrido desde que se recibe la llamada hasta que se toma la decisión de clasificación de la AMD.
Tasa de anulación del agente
Porcentaje de llamadas en las que los agentes corrigen la decisión de AMD.
Resumen de referencia
Resumen público de los pilotos internos
Si lo desea, puede solicitar cifras detalladas por idioma, por operador y por región procedentes de nuestros programas piloto internos.
| Métrico | Resumen público | Notas |
|---|---|---|
| Llamadas evaluadas | Rango de 10.000 a 50.000 | En todas las campañas piloto internas |
| Rango de fechas | Primer y segundo trimestre de 2026 | Actualizado a medida que se disponga de nuevos datos piloto. |
| Idiomas probados | 9 | EN, AR, ES, FR, IT, DE, TR, HI, UR |
| Regiones analizadas | Oriente Medio y Norte de África, Europa, Norteamérica | La combinación de operadores varía según la región. |
| Tipos de campaña | Cobranzas, BPO, ventas, seguros | Resultados segmentados siempre que sea posible. |
| Tasa de falsos positivos de AMD | Por debajo del 3% en pilotos seleccionados | Un ser humano fue clasificado erróneamente como máquina. |
| Tasa de falsos negativos de AMD | Por debajo del 5% en pilotos seleccionados | Máquina clasificada erróneamente como humana |
| Latencia de detección mediana | Menos de 1 segundo | Decisión de Recogida de AMD |
| latencia de detección P90 | Menos de 1,5 segundos | Decisión de Recogida de AMD |
| tasa de anulación del agente | rango del 2 al 5% | Tasa de corrección manual en campañas piloto |
| Elevación de la tasa de contacto | Hasta 4 veces más rápido que la marcación manual. | En flujos de trabajo piloto, los resultados varían. |
| Reducción del tiempo de inactividad | Rango del 30 al 45% | En campañas piloto seleccionadas |
Basado en pruebas piloto internas. Los resultados varían según el tipo de campaña, la calidad de la lista, la operadora, la región, el idioma, la configuración de ritmo y el flujo de trabajo del agente. El comportamiento varía lo suficiente según el idioma y la operadora, por lo que preferimos medirlo en sus rutas durante una prueba piloto en lugar de publicar un promedio que no coincidirá con lo que usted observa.
Idiomas evaluados
Once idiomas, datos reales de pilotos
EN
Inglés
AR
árabe
ES
Español
FR
Francés
IT
italiano
DE
Alemán
TR
turco
HI
hindi
UR
Urdu
Los parámetros de referencia del árabe incluyen variantes dialectales del Golfo Pérsico, el Levante y Egipto. Los parámetros de referencia del hindi y el urdu incluyen la cobertura de variantes regionales. Cada idioma se evalúa de forma independiente con desgloses específicos para cada operador y región.
Limitaciones
¿Qué puntos de referencia? no puedo decírtelo
Los resultados varían según el operador. Cada operador ofrece diferentes mensajes de bienvenida en el buzón de voz, calidad de audio y tiempos de conexión.
Los resultados varían según el tipo de campaña. Las campañas de cobro tienen patrones de respuesta diferentes a las campañas de ventas o encuestas.
Los resultados varían según la región. Los estilos de saludo del buzón de voz, la infraestructura del operador y las condiciones de la red difieren entre los distintos mercados.
Los resultados varían según la calidad de la lista. Los números obsoletos, los números incorrectos y las líneas desconectadas afectan el rendimiento de AMD de manera diferente.
Los indicadores de referencia reflejan el rendimiento global. Los resultados de cada campaña pueden ser superiores o inferiores a los promedios publicados.
Datos completos de referencia del piloto interno disponibles bajo petición.
Los informes internos de evaluación comparativa para pilotos, que incluyen tablas de precisión por idioma, desgloses específicos por operador y datos históricos de tendencias, están disponibles para clientes potenciales cualificados bajo un acuerdo de confidencialidad. Póngase en contacto con nuestro equipo para solicitar acceso.
Solicitar datos de referencia
Reserva una demostración y compartiremos resultados detallados de las pruebas de rendimiento de AMD, adaptados a tu idioma, región y tipo de campaña.