Исследования20 июля 2026 г., 23:16 МСК🤖 Auto

AI-голосовой фишинг: ИИ обманывает людей так же, как люди, но дешевле

Масштабное исследование (N=4100) показало, что современные AI-модели синтеза речи достигли уровня человеческих мошенников по эффективности, а стоимость атаки кратно ниже.

Баннер новости 3980

Масштаб угрозы: 36% жертв верят ИИ

Исследователи провели крупномасштабное экспериментальное исследование с участием 4 100 взрослых жителей США, чтобы оценить уязвимость людей перед AI-голосовым фишингом (vishing). В тесте участвовали шесть ведущих моделей синтеза речи: Sesame, ElevenLabs, Llama Full Duplex (Llama FD), Gemini, OpenAI AVM и Play.AI.

Ключевой вывод: до 36% участников были готовы выполнить требования мошенника в сценариях, вызывающих эмоциональный отклик (например, «сестра в беде»). Общая доля людей, согласившихся или сомневающихся в отказе, составила 16,5% по всем категориям мошенничества. При этом участники не смогли достоверно отличить ИИ-голос от человеческого: точность определения ИИ составила всего 24,3–45,8% в аудио-формате.

Сравнение моделей: Кто обманывает лучше?

Модель Sesame показала статистически значимое паритет с человеческим голосом по параметру «человечности» (human-likeness) и стала самой сложной для обнаружения (правильно идентифицирована как ИИ лишь в 33,7% случаев). ElevenLabs также продемонстрировала уровень, сопоставимый с людьми, особенно в задачах клонирования голоса.

Метрика / Сценарий Результат / Значение Примечание
Общая доля уязвимых (Compliance) 16,5% Среднее по всем сценариям
Максимальная уязвимость (Сценарий «Сестра в беде») 36,1% Использовало клонированный голос ElevenLabs
Уязвимость (Сценарий «Полиция-Бабушка») 24,1% (ИИ) / 24,1% (Человек) Паритет с человеческим мошенником
Уязвимость (Сценарий «Пожертвование») 32,6% (Человек) Высокий уровень доверия к эмоциональному призыву
Точность распознавания ИИ (Аудио) 24,3% – 45,8% Люди чаще ошибаются, чем угадывают
Самая сложная модель для детекции Sesame Идентифицирована как ИИ в 33,7% случаев

Экономика мошенничества: Почему это выгодно

Авторы исследования подчеркивают, что главная опасность текущего момента — не в «сверхчеловеческой» убедительности ИИ, а в экономической эффективности. В то время как традиционный голосовой фишинг с участием людей часто убыточен из-за высоких затрат на заработную плату, автоматизированные AI-атаки рентабельны. Стоимость генерации голоса и прозвона кратно ниже, а масштабируемость позволяет атаковать миллионы пользователей одновременно без потери качества.

Почему люди верят ботам

Статистический анализ выявил, что главным предиктором успешности атаки является убедительность звонящего (persuasiveness), а не факт того, является ли он человеком или ИИ. Эмоционально заряженные сценарии (родственник в беде, полиция) увеличивали шансы на успех мошенника в 3–5 раз по сравнению с сухими запросами о поддержке аккаунта (MasterCard, Gmail).

Интересно, что опыт использования AI-ассистентов не делает пользователей более защищенными: люди, часто использующие ИИ, не лучше справляются с детекцией ИИ-голосов, чем новички. Это указывает на то, что проблема лежит в плоскости психологического воздействия, а не технической подмены голоса.

Источник: LessWrong ↗