¿Qué es AMD (Detección de contestador automático)?
Qué es la detección de contestadores automáticos: cómo funciona la detección de pitidos, por qué falla y cómo AMD basado en IA, clasifica las llamadas a partir de transcripciones en diferentes idiomas.
Respuesta rápida
La detección de contestador automático ( AMD , por sus siglas en inglés) es la tecnología que utiliza un marcador telefónico saliente para determinar si una llamada fue contestada por una persona o por un contestador automático. Permite que el sistema conecte las respuestas de los operadores con los agentes y gestione los mensajes de voz automáticamente; su precisión, especialmente en distintos idiomas, influye directamente en las tasas de contacto y el cumplimiento normativo.
La detección de contestador automático (conocida universalmente como AMD) es la tecnología integrada en un marcador telefónico que determina, en los primeros segundos de una llamada conectada, si la contestó una persona o un sistema de correo de voz. Según esta clasificación, el marcador dirige la llamada a un agente (persona) o la gestiona automáticamente (máquina, normalmente reproduciendo un mensaje de voz pregrabado o desconectando).
AMD parece sencillo, pero es uno de los componentes más importantes en cualquier sistema de llamadas salientes. Su precisión controla directamente dos métricas empresariales clave: la utilización de agentes (cuánto tiempo dedican los agentes a hablar con personas reales) y la tasa de contacto (cuántas conversaciones en vivo genera la campaña por hora). Unos pocos puntos porcentuales de precisión de AMD pueden traducirse en miles de conversaciones perdidas o ganadas por semana para una empresa mediana.
Cómo funciona AMD tradicional
El AMD tradicional —el enfoque que ha sido estándar en los marcadores salientes durante más de dos décadas— se basa en el análisis de la señal de audio aplicado a los primeros momentos después de que se conecta una llamada. Existen dos técnicas principales:
Análisis de energía y duración
Cuando se establece una llamada, el sistema AMD comienza a analizar la forma de onda del audio. Mide dos cosas: la duración del segmento de voz inicial y el patrón energético de esa voz. La premisa subyacente es que los saludos humanos son breves —«¿Hola?», «¿Sí?», «Hablando»—, generalmente de menos de 1,5 segundos, seguidos de una pausa en la que la persona espera una respuesta. Los saludos de correo de voz, en cambio, tienden a ser más largos (de 3 a 10 segundos de habla continua) sin pausas naturales, porque el saludo es un monólogo pregrabado.
El sistema aplica un umbral de decisión: si el habla continúa durante un tiempo superior al configurado sin pausas, clasifica la llamada como proveniente de una máquina. Si el habla es breve y va seguida de silencio, clasifica la llamada como proveniente de una persona real.
Detección de pitidos
La segunda técnica tradicional detecta el tono característico —el "pitido"— que indica el final del saludo del buzón de voz y el inicio de la grabación. Cuando el sistema detecta un tono que coincide con la frecuencia y duración esperadas del pitido del buzón de voz (normalmente un tono de 1 kHz con una duración de entre 0,5 y 1 segundo), clasifica la llamada como una máquina.
La detección de pitidos se diseñó originalmente como una confirmación secundaria tras el análisis de energía. En algunos sistemas antiguos, se convirtió en el método de detección principal. La llamada se mantenía en un búfer de detección hasta que se oía un pitido (en el caso de una máquina) o expiraba un tiempo de espera (en el caso de un humano).
¿Por qué falla la detección tradicional mediante pitidos?
El AMD tradicional fue diseñado para un panorama de telefonía que ya no existe. Varios cambios estructurales han hecho que la detección basada en pitidos y en energía sea cada vez menos fiable:
Inconsistencia en los pitidos entre operadores
La suposición de que todos los sistemas de correo de voz emiten un pitido estandarizado tras el saludo ya no es válida. Google Voice utiliza un patrón de tonos diferente al de los sistemas de correo de voz tradicionales. Algunos proveedores de VoIP omiten el pitido por completo y simplemente comienzan a grabar tras una pausa. Los sistemas de correo de voz visuales en los teléfonos inteligentes modernos pueden no emitir ningún pitido, ya que el paradigma de saludo y grabación ha sido reemplazado por una interfaz visual. Los sistemas de correo de voz específicos de cada operador en Oriente Medio, el sur de Asia y África utilizan frecuencias, duraciones y patrones de tonos diferentes a los de los sistemas norteamericanos o europeos.
Saludando la diversidad
La detección basada en energía asume que el habla larga equivale a una máquina y el habla corta a una persona. Pero esta suposición falla en muchos escenarios del mundo real. Algunas personas responden con saludos largos —«Hola, ha llamado a John, estoy en mi escritorio, ¿en qué puedo ayudarle?»— que se clasifican como máquina. Algunos sistemas de correo de voz utilizan saludos muy cortos predeterminados del operador —«Deje un mensaje»— que se clasifican como humanos. En mercados multilingües, las convenciones de saludo varían según el idioma y la cultura. Los saludos árabes, por ejemplo, suelen incluir saludos más largos («As-salamu alaykum wa rahmatullahi wa barakatuh») que pueden exceder el umbral de duración y generar un falso positivo.
Variabilidad de la red
Las llamadas internacionales, las conexiones VoIP a PSTN y las transferencias de red móvil introducen latencia variable y degradación de la calidad del audio. La pérdida de paquetes puede crear interrupciones en el flujo de audio que se asemejan a las pausas entre segmentos del habla humana. La fluctuación de la latencia (jitter) puede alargar o comprimir la duración aparente del habla. La transcodificación del códec puede alterar las características de frecuencia de los tonos de pitido. Todos estos efectos añaden ruido a la señal en la que se basan los algoritmos AMD tradicionales para la clasificación.
El problema del saludo predeterminado del operador
Muchos operadores, sobre todo en mercados emergentes, reproducen un saludo predeterminado cuando el abonado no ha grabado uno personal. Estos saludos suelen ser breves, lo pronuncia un locutor profesional y suenan muy parecidos a una persona real. El sistema AMD tradicional no puede distinguir entre el mensaje "La persona a la que llama no está disponible" del saludo predeterminado del operador y "Hola, soy Sarah" pronunciado por una persona real; ambos son mensajes cortos y claros seguidos de una pausa.
Cómo funciona AMD basado en IA
AMD basado en IA adopta un enfoque fundamentalmente diferente al problema de la clasificación. En lugar de analizar las características de la señal de audio (duración, energía, frecuencia), transcribe los primeros segundos del habla y clasifica contenido semántico de lo que se dijo.
Aquí está el proceso, paso a paso:
Paso 1: Captura de audio. Cuando se establece la conexión de la llamada y comienza a fluir el audio, el sistema AMD captura los primeros 2-4 segundos de habla de la persona que realiza la llamada remota.
Paso 2: Transcripción de voz a texto. El audio capturado es procesado por un modelo de reconocimiento de voz que lo convierte a texto. Este modelo debe ser compatible con el idioma que se está hablando, un requisito fundamental para las operaciones multilingües.
Paso 3: Clasificación de texto. El texto transcrito es analizado por un modelo de clasificación que determina si el contenido coincide con patrones asociados a respuestas humanas en directo o a mensajes de voz.
Consideremos la diferencia en cómo suena normalmente cada tipo de respuesta al transcribirla:
- Patrones humanos vivos: "Hola?" / "¿Sí?" / "Hablando" / "¿Quién es?" / "Alo?" (turco) / "Haan bolo" (hindi) / "Naam" (árabe) — respuestas cortas, interrogativas y expectantes.
- Patrones de correo de voz: "La persona a la que llama no está disponible. Por favor, deje un mensaje después del tono." / "Hola, ha llamado a [nombre]. No puedo atender su llamada en este momento..." / "Al-shakhs alladhi tattasil bihi ghayr mutah..." (predeterminado de operador árabe) — mensajes más largos, declarativos e informativos.
Paso 4: Puntuación de confianza y decisión. El clasificador devuelve un índice de confianza. Si la confianza supera el umbral configurado, la clasificación se aplica inmediatamente. Si la confianza es inferior al umbral, el sistema puede capturar audio adicional antes de emitir una decisión final. Este enfoque por etapas reduce tanto los falsos positivos como la latencia de detección.
Comparativa entre AMD con IA y AMD tradicional
| Dimensión | Tradicional (pitido/energía) | Clasificación de transcripciones basada en IA |
|---|---|---|
| Método de detección | Análisis de la señal de audio: duración, energía, frecuencia del tono de pitido. | Transcripción de voz a texto seguida de clasificación del contenido semántico. |
| Soporte de idiomas | En teoría, es independiente del idioma, pero está optimizado para los patrones de saludo en inglés y los tonos de aviso de las operadoras estadounidenses y británicas. | Requiere modelos de transcripción específicos para cada idioma; la precisión aumenta con la cobertura lingüística. |
| Precisión en las llamadas en inglés | Funciona razonablemente bien en líneas fijas estadounidenses con buzón de voz estándar del operador. Su rendimiento disminuye en VoIP, móviles y con saludos no estándar. | Mayor precisión de forma constante porque la clasificación se basa en el significado, no en las características de audio. |
| Precisión en llamadas en idiomas distintos al inglés | Deficiente. Los umbrales de duración y energía calibrados para los patrones de saludo en inglés producen altas tasas de falsos positivos en árabe, hindi, turco y otros idiomas con diferentes convenciones de saludo. | Alta precisión cuando el modelo de transcripción admite el idioma de destino. Los patrones de saludo de cada idioma se aprenden de forma independiente. |
| Tasa de falsos positivos | Entre un 5% y un 15%, dependiendo del mercado y la combinación de operadores. | Por debajo del 3 % en condiciones piloto internas en todos los idiomas admitidos. |
| Variación del buzón de voz del operador | Sensible a las diferencias de la portadora. La frecuencia, la duración y la presencia del pitido varían. Requiere ajuste manual continuo. | Es en gran medida inmune a las variaciones del operador porque el sistema clasifica el contenido, no los patrones de tono. |
| Latencia de detección | 1-3 segundos (espera a que se alcance el umbral de duración del habla o a que suene un pitido) | 2-4 segundos (espera a que haya suficiente habla para transcribir y clasificar) |
| Adaptación | Ajuste manual de umbrales por parte del equipo de operaciones | Ajuste personalizado para cada inquilino mediante bucles de retroalimentación de agentes: los agentes pueden señalar clasificaciones erróneas que informan sobre ajustes del modelo. |
Por qué importa la precisión de AMD: La matemática de los falsos positivos
El impacto comercial de la precisión de AMD suele subestimarse porque los índices de error parecen pequeños en términos porcentuales. Sin embargo, al aplicarlos al volumen de llamadas en una campaña típica de llamadas salientes, esos pequeños porcentajes se convierten en cifras absolutas considerables.
Veamos un ejemplo concreto:
Supongamos una operación de marcación predictiva con 50 agentes que trabajan en turnos de 8 horas. Cada agente gestiona aproximadamente 150 llamadas conectadas al día. El equipo conecta en total unas 7500 llamadas diarias. De estas, aproximadamente el 35 % logran comunicarse con un operador humano (2625 llamadas) y el 65 % se desvían al buzón de voz o resultan improductivas (4875 llamadas).
Ahora bien, consideremos la tasa de falsos positivos: la tasa a la que AMD clasifica erróneamente a una persona real como un mensaje de voz y desconecta la llamada:
- Con una tasa de falsos positivos del 10 % (típica para AMD tradicional en llamadas que no son en inglés): Cada día se desconectan 263 personas en directo. En un mes laboral de 22 días, esto supone la pérdida de 5786 conversaciones en directo. Cada una de ellas correspondía a una persona que contestó al teléfono, escuchó un breve silencio y le colgaron.
- Con una tasa de falsos positivos del 5% (AMD tradicional en llamadas en inglés bien ajustadas): Cada día se desconectan 131 personas en directo. Mensualmente: 2.882 conversaciones perdidas.
- Con una tasa de falsos positivos del 3%: Cada día se desconectan 79 personas en directo. Mensualmente: 1738 conversaciones perdidas.
La diferencia entre esas dos tasas es 4.048 conversaciones en directo adicionales al mes. Para el mismo equipo, la misma lista y el mismo horario. Las tarifas anteriores son solo ejemplos ilustrativos, no datos de referencia de los proveedores. Solicite a cualquier proveedor, incluido nosotros, cifras basadas en un tráfico similar al suyo. En un entorno de gestión de cobros donde cada contacto con la persona adecuada tiene un valor de recuperación cuantificable, o en un entorno de ventas donde cada conversación genera valor para el embudo de ventas, el impacto en los ingresos es considerable.
Y el coste no se limita a las conversaciones perdidas. Cada falso positivo representa un punto de contacto negativo con la marca: una persona que contestó el teléfono y a la que le colgaron. En sectores regulados, un número excesivo de llamadas abandonadas puede desencadenar investigaciones de cumplimiento normativo. En mercados donde las quejas de los consumidores provocan el bloqueo de números, los falsos positivos aceleran el deterioro de la reputación del identificador de llamadas.
El desafío multilingüe de AMD
La precisión de AMD no es uniforme en todos los idiomas. Los sistemas AMD tradicionales se diseñaron principalmente para mercados de habla inglesa, específicamente para operadores de EE. UU. y el Reino Unido con sistemas de correo de voz estandarizados. Al implementarse en otros mercados, su precisión se degrada significativamente debido a varios factores:
Convenciones sobre la duración de los saludos. Los saludos formales en árabe pueden durar más de 3 o 4 segundos de habla continua, lo que puede provocar fácilmente falsos positivos basados en la duración. Los saludos en hindi varían mucho según la región y el nivel de formalidad. Los saludos en turco tienen patrones prosódicos diferentes a los del inglés. Cada idioma tiene su propia duración y estructura de saludo "normales".
Sistemas de correo de voz de operadores. La implementación del correo de voz varía según el país y el operador. Los operadores del CCG (Etisalat, STC, Ooredoo, du, Zain) tienen diferentes saludos, patrones de tono y comportamientos predeterminados. Los operadores del sur de Asia (Jio, Airtel, PTCL, Jazz) presentan variaciones similares. Los operadores europeos (Vodafone, Orange, Deutsche Telekom) tienen sus propios patrones. Un sistema entrenado con el correo de voz de AT&T y Verizon tendrá un rendimiento deficiente con du y Etisalat.
Cambio de código. En muchos mercados, los hablantes alternan entre idiomas dentro de un mismo saludo: inglés y árabe en el CCG, hindi e inglés en India, y urdu e inglés en Pakistán. El AMD tradicional no cuenta con un marco para gestionar saludos en varios idiomas. El AMD basado en IA con transcripción multilingüe puede gestionar la alternancia de códigos de forma natural, ya que clasifica el contenido independientemente del idioma en que se haya producido.
En qué se diferencia la IA AMD de DialerBee
DialerBee , desarrollado por BroadNet con 22 años de experiencia en telecomunicaciones, aborda AMD como un problema que prioriza la multilingüística. Esto es lo que significa en la práctica:
Transcripción y clasificación en 9 idiomas. AMD de DialerBee admite inglés, árabe, español, francés, alemán, italiano, turco, hindi, urdu, portugués e indonesio. Cada idioma cuenta con una función de transcripción específica y patrones de clasificación propios. No se trata de un único modelo en inglés aplicado a todas las llamadas, sino que cada idioma se gestiona mediante modelos que tienen en cuenta las convenciones de saludo, los patrones de la operadora y las normas culturales propias de ese idioma.
La clasificación se basa en la transcripción, no en los pitidos. En todos los idiomas compatibles, el sistema AMD de IA de DialerBee logra tasas de falsos positivos inferiores al 3 % en pruebas piloto internas. Los resultados varían según la campaña, la calidad de la lista, el proveedor, la región, el ritmo y el flujo de trabajo. Esto representa una mejora significativa con respecto a las tasas de falsos positivos del 5 % al 15 % típicas de los sistemas tradicionales de detección de pitidos, especialmente en llamadas en idiomas distintos del inglés.
Ajustes específicos para cada inquilino. En un entorno multiusuario (empresas de externalización de procesos de negocio que gestionan campañas para múltiples clientes, revendedores que atienden a varios clientes finales), el comportamiento de AMD se puede ajustar para cada usuario. Los bucles de retroalimentación permiten a los agentes identificar llamadas mal clasificadas, y esta información sirve de base para realizar ajustes en el modelo adaptados a los patrones de tráfico específicos de cada usuario. Esto resulta especialmente valioso para operaciones que se conectan a redes de operadores especializados o a mercados regionales específicos.
Sin dependencia de pitidos. El sistema AMD de DialerBee no depende de la detección de pitidos en ninguna etapa. La clasificación se basa completamente en el contenido transcrito del discurso inicial. Esto lo hace inmune a las variaciones de pitidos específicas de cada operador que afectan a los sistemas tradicionales: la ausencia de pitido, un pitido no estándar, un pitido retardado o varios pitidos dan como resultado la misma clasificación correcta, ya que el sistema nunca necesitó el pitido.
Acciones de disposición configurables. Cuando AMD clasifica una llamada como automática, los administradores de campaña pueden configurar la acción a seguir: finalizar la llamada silenciosamente, reproducir un mensaje de voz pregrabado o redirigirla a un flujo IVR específico. Estas acciones se pueden configurar por campaña y por cliente, lo que permite a los equipos de operaciones tener un control total sobre cómo se gestionan las llamadas detectadas como automáticas.
Integración con marcación predictiva. La precisión de AMD impacta directamente en la efectividad de marcación predictivaCuando AMD filtra correctamente las conexiones de correo de voz, el algoritmo predictivo recibe información más precisa sobre las tasas de conexión reales y puede gestionar las llamadas con mayor exactitud. Un AMD deficiente introduce datos erróneos en el algoritmo predictivo, lo que provoca pérdidas de eficiencia en cascada. La estrecha integración de DialerBee entre su IA AMD y su motor de marcación predictiva permite que ambos sistemas se refuercen mutuamente.
Preguntas frecuentes
¿Qué significan las siglas AMD en un centro de llamadas?
AMD significa Detección de Contestador Automático. Es el componente de un marcador telefónico que determina si una llamada conectada fue atendida por un operador humano o por un sistema de correo de voz. Esta clasificación se realiza en los primeros 2 a 4 segundos de la conexión de la llamada y determina si se dirige a un agente o se gestiona automáticamente.
¿Qué tan precisa es la detección de contestadores automáticos?
La precisión varía significativamente según la tecnología y el mercado. AMD tradicional con detección de pitidos suele alcanzar una precisión del 85-95 % en llamadas en inglés estadounidense con correo de voz estándar del operador, pero la precisión disminuye al 80-90 % en llamadas en otros idiomas, números móviles y líneas VoIP . AMD basado en IA, que utiliza transcripción y clasificación, logra una mayor precisión: el sistema AMD con IA de DialerBee utiliza clasificación basada en transcripciones. Los resultados varían según la campaña, la calidad de la lista, el proveedor, la región, el ritmo y el flujo de trabajo.
¿Cuál es la diferencia entre AMD y la detección de correo de voz?
Los términos suelen ser intercambiables. "Detección de contestador automático" es el término estándar del sector, utilizado por los fabricantes de sistemas de marcación, los ingenieros de telecomunicaciones y las normativas de cumplimiento. "Detección de correo de voz" es un término más coloquial que significa lo mismo. Algunos sistemas distinguen entre "contestador automático" (un dispositivo físico) y "correo de voz" (un servicio alojado por el operador), pero en el uso actual, AMD abarca ambos.
¿AMD provoca un retraso antes de que la persona que llama escuche al agente?
Sí. El análisis de audio por parte del usuario (AMD) requiere un breve período de análisis de audio antes de poder clasificar la llamada. El AMD tradicional suele tardar entre 1 y 3 segundos, mientras que el AMD basado en IA suele tardar entre 2 y 4 segundos. Durante este tiempo, la persona que contesta puede escuchar un breve silencio antes de ser conectada con un agente. Este retraso en el AMD es una compensación conocida: ventanas de detección más cortas implican una conexión más rápida con el agente, pero menor precisión, mientras que ventanas más largas mejoran la precisión, pero aumentan el silencio que experimenta la persona que llama. Los sistemas modernos optimizan este equilibrio mediante el uso de umbrales de confianza escalonados: las clasificaciones de alta confianza se aplican rápidamente, mientras que los casos ambiguos reciben tiempo de análisis adicional.
¿Se puede desactivar AMD?
Sí. La mayoría de los sistemas de marcación automática, incluido DialerBee, permiten desactivar AMD por campaña. Cuando AMD está desactivado, cada llamada conectada se dirige directamente a un agente, independientemente de si responde una persona o una máquina. Esto elimina por completo los falsos positivos, pero implica que los agentes gestionarán las conexiones de correo de voz manualmente: escucharán el saludo, reconocerán que es una máquina y colgarán. Para campañas de bajo volumen, campañas de marcación con vista previa o campañas donde cada intento de contacto es de alto valor, desactivar AMD puede ser la opción más adecuada.
¿Cómo gestiona la IA de AMD las llamadas en las que nadie habla?
Cuando se establece una llamada pero no se detecta voz dentro del tiempo de espera configurado (normalmente de 3 a 5 segundos), el sistema aplica una clasificación alternativa. Esta situación puede ocurrir cuando una persona contesta y espera en silencio, cuando se conecta un fax o cuando un operador reproduce silencio antes de un mensaje del sistema. La mayoría de las operaciones configuran la clasificación alternativa para que la llamada se dirija a un agente (suponiendo que es más probable que una persona en silencio que una máquina), pero esto se puede configurar para cada campaña según las prioridades de la operación y las características de la lista a la que se llama.
Términos relacionados
¿Qué es un marcador automático?
Un marcador automático es un software que marca automáticamente números de una lista y conecta a los agentes con respuestas en vivo. Conozca los tipos, usos, beneficios y cumplimiento normativo.
¿Qué es la tasa de respuesta?
La tasa de respuesta es el porcentaje de llamadas salientes realizadas que son contestadas por una persona o una máquina. Aprenda la fórmula, qué la determina y cómo mejorarla.
¿Qué es el tiempo medio de gestión (AHT)?
El tiempo medio de gestión (AHT, por sus siglas en inglés) es el tiempo total promedio que un agente dedica a una interacción: conversación, espera y trabajo posterior a la llamada.
¿Qué es BYOC (Bring Your Own Carrier)?
BYOC (trae tu propio operador) permite a una empresa conectar sus propios troncales SIP y su operador de telecomunicaciones a una plataforma de comunicaciones en lugar de utilizar servicios de telefonía integrados.
¿Qué es la tasa de conexión?
La tasa de conexión es el porcentaje de intentos de marcación saliente que resultan en una llamada conectada. Aprenda la fórmula, los factores que la influyen, los indicadores de referencia y cómo mejorarla.
¿Qué es la tasa de contacto?
La tasa de contacto es el porcentaje de registros marcados en los que una campaña de llamadas salientes llega a la persona prevista o a una persona real.
¿Listo para ver DialerBee en acción?
Reserva una demostración en vivo de 15 minutos o comienza una prueba gratuita y llama hoy mismo; sin diapositivas, sin compromiso.
Prueba gratuita de 14 días · Sin tarjeta de crédito · 11 idiomas · BYOC · Controles que respaldan el cumplimiento normativo