Benchmark
Performa AMD . Diukur secara jujur.
Metodologi tolok ukur kami, metrik yang kami lacak, bahasa yang kami uji, dan keterbatasan yang kami akui. Jika kami tidak memiliki angka yang diukur pada lalu lintas seperti milik Anda, kami akan menyatakannya secara eksplisit daripada mengutip angka tertentu.
Tolok Ukur Kami
Akurasi AMD lintas bahasa
AI AMD DialerBee menggunakan klasifikasi transkrip pada 3 detik pertama audio panggilan untuk menentukan apakah yang menjawab adalah manusia atau mesin penjawab. Kami menguji sistem ini di berbagai bahasa, lingkungan operator, dan jenis kampanye untuk mengukur akurasi di dunia nyata.
Berbeda dengan vendor yang melaporkan akurasi kondisi laboratorium, tolok ukur kami mencerminkan data produksi dengan semua gangguan, variabilitas operator, dan perbedaan regional yang menyertai kampanye pemasaran keluar yang sebenarnya.
Metodologi
Bagaimana kita mengukur akurasi
Klasifikasi Transkrip
Model AMD mengklasifikasikan transkrip waktu nyata dari 3 detik pertama audio. Model ini membaca kata dan frasa, bukan bentuk gelombang audio atau pola bunyi bip.
Penggantian Agen sebagai Kebenaran Dasar
Ketika agen tidak setuju dengan klasifikasi AMD , mereka menandainya hanya dengan satu klik. Penolakan ini berfungsi sebagai label kebenaran dasar untuk mengukur akurasi.
Evaluasi Berkelanjutan
Benchmark bukanlah pengujian sekali saja. Kami terus menerus mengevaluasi akurasi terhadap serangkaian penggantian agen di semua kampanye produksi.
Metrik yang Dilacak
Lima metrik masalah itu
Ketepatan
Tingkat kebenaran klasifikasi keseluruhan di semua panggilan.
Tingkat Positif Palsu
Panggilan manusia yang salah diklasifikasikan sebagai panggilan mesin.
Tingkat Negatif Palsu
Panggilan mesin salah diklasifikasikan sebagai panggilan manusia.
Latensi Deteksi
Waktu dari saat panggilan diangkat hingga keputusan klasifikasi AMD .
Tarif Penggantian Agen
Persentase panggilan di mana agen mengoreksi keputusan AMD .
Ringkasan Tolok Ukur
Ringkasan publik dari uji coba internal
Data rinci per bahasa, per operator, dan per wilayah dari uji coba internal kami tersedia berdasarkan permintaan.
| Metrik | Ringkasan Publik | Catatan |
|---|---|---|
| Panggilan dievaluasi | Kisaran 10.000–50.000 | Melalui kampanye percontohan internal |
| Rentang tanggal | Kuartal 1–Kuartal 2 tahun 2026 | Diperbarui seiring tersedianya data pilot baru. |
| Bahasa yang diuji | 9 | EN, AR, ES, FR, IT, DE, TR, HI, UR |
| Wilayah yang diuji | MENA, Eropa, Amerika Utara | Komposisi operator seluler bervariasi menurut wilayah. |
| Jenis kampanye | Penagihan, BPO, penjualan, asuransi | Hasil disegmentasikan jika memungkinkan |
| Tingkat positif palsu AMD | Di bawah 3% pada pilot terpilih | Manusia salah diklasifikasikan sebagai mesin |
| Tingkat negatif palsu AMD | Di bawah 5% pada pilot terpilih | Mesin salah diklasifikasikan sebagai manusia |
| Latensi deteksi median | Kurang dari 1 detik | Keputusan untuk beralih ke AMD |
| Latensi deteksi P90 | Kurang dari 1,5 detik | Keputusan untuk beralih ke AMD |
| Tingkat pengesampingan agen | kisaran 2–5% | Tingkat koreksi manual dalam kampanye percontohan |
| Peningkatan laju kontak | Hingga 4x lebih cepat dibandingkan dengan panggilan manual. | Dalam alur kerja percontohan, hasilnya bervariasi. |
| Pengurangan waktu menganggur | kisaran 30–45% | Dalam kampanye percontohan terpilih |
Berdasarkan tolok ukur uji coba internal. Hasil bervariasi tergantung jenis kampanye, kualitas daftar, operator, wilayah, bahasa, konfigurasi kecepatan, dan alur kerja agen. Perilaku per bahasa dan per operator cukup bervariasi sehingga kami lebih memilih mengukurnya di rute Anda selama uji coba daripada menerbitkan rata-rata yang tidak akan sesuai dengan apa yang Anda lihat.
Bahasa yang Diuji
Sebelas bahasa, data pilot sebenarnya
EN
Bahasa inggris
AR
Arab
ES
Spanyol
FR
Perancis
IT
Italia
DE
Jerman
TR
Turki
HI
Hindi
UR
Bahasa Urdu
Tolok ukur bahasa Arab mencakup varian dialek Teluk, Levant, dan Mesir. Tolok ukur bahasa Hindi dan Urdu mencakup cakupan varian regional. Setiap bahasa diukur secara independen dengan rincian khusus operator dan khusus wilayah.
Keterbatasan
Tolok ukur apa saja? tidak bisa memberi tahu Anda
Hasilnya bervariasi tergantung operator. Operator yang berbeda menghasilkan salam pesan suara, kualitas audio, dan waktu koneksi yang berbeda.
Hasilnya bervariasi tergantung jenis kampanye. Kampanye penagihan memiliki pola pengambilan data yang berbeda dibandingkan kampanye penjualan atau survei.
Hasilnya bervariasi menurut wilayah. Gaya sapaan pesan suara, infrastruktur operator, dan kondisi jaringan berbeda di setiap pasar.
Hasilnya bervariasi tergantung kualitas daftar. Angka yang sudah usang, angka yang salah, dan baris yang terputus memengaruhi kinerja AMD secara berbeda.
Tolok ukur mencerminkan kinerja agregat. Hasil kampanye individual mungkin lebih tinggi atau lebih rendah daripada rata-rata yang dilaporkan.
Data lengkap tolok ukur uji coba internal tersedia berdasarkan permintaan.
Laporan tolok ukur uji coba internal dengan tabel akurasi per bahasa, rincian khusus operator, dan data tren historis tersedia untuk calon pelanggan yang memenuhi syarat berdasarkan perjanjian kerahasiaan (NDA). Hubungi tim kami untuk meminta akses.
Minta data benchmark
Pesan demo dan kami akan membagikan hasil benchmark AMD terperinci yang relevan dengan bahasa, wilayah, dan jenis kampanye Anda.