Суть проблемы: AI-помощник против человеческой хитрости
Проект Alex — это голосовой агент на базе LiveKit, имитирующий сотрудника логистического брокерства. Его задача — согласовывать ставки с водителями-перевозчиками. В сценарии тестирования груз весом 42 000 фунтов следует маршрутом Чикаго — Даллас (925 миль). Грузоотправитель платит брокеру $3 300. Брокер хочет заплатить водителю $2 700, оставляя себе маржу в $600.
Агент работает с тремя конфиденциальными цифрами: стартовая цена $2 450, целевая $2 700 и абсолютный потолок $2 950. Главная проблема LLM-агентов в переговорах — их обученность быть полезными и вежливыми, что делает их уязвимыми к манипуляциям, в отличие от людей, которые умеют хранить секреты.
Результаты первого запуска: «Лимит соблюден, но деньги потеряны»
Первая версия агента была настроена через системный промпт, где явно указывалось не называть лимит. В ходе 30 тестовых переговоров модель строго соблюдала техническое ограничение: она никогда не согласилась на сумму выше $2 950. Однако анализ транскриптов выявил более тонкую проблему — утечку маржи.
Агент в среднем отдавал 40% от защищаемой маржи. В четырех из десяти случаев (40%) он отдавал всю доступную разницу. Это произошло из-за того, что модель, пытаясь быть «компромиссной», добровольно раскрывала информацию или уступала слишком быстро, не дожидаясь жесткого сопротивления.
Второй запуск: Жесткий контроль через архитектуру
Для исправления ситуации была внедрена вторая версия с двумя слоями защиты. Ключевое изменение: агент больше не может произносить или соглашаться на числа, которые не были предварительно одобрены кодом. Это исключило возможность случайной утечки лимита через естественный язык.
| Метрика | Версия 1 (Промпт) | Версия 2 (Контроль кода) |
|---|---|---|
| Соблюдение макс. цены ($2 950) | Да (100% случаев) | Да (100% случаев) |
| Средняя потеря маржи | 40% | 14% |
| Полная потеря маржи (в 4/10 атаках) | Да | Нет |
| Механизм защиты | Текстовый промпт | Жесткое ограничение на вывод чисел |
Почему это важно для индустрии
Тест демонстрирует, что безопасности LLM недостаточно. Даже если модель не нарушает явных инструкций, она может быть «атакована» через психологические приемы (например, тактику «якоря» и уступок). Для бизнеса, внедряющего AI-агентов в финансовые переговоры, критически важно разделять логику принятия решений и интерфейс общения. Простое добавление числовых фильтров на уровне кода снизило потери маржи с 40% до 14%, что делает технологию экономически оправданной.
Источник: Towards AI pub ↗
