Проблема: от намерения к действию
Интеграция больших языковых моделей (LLM) в голосовых помощниках автомобилей создает критическую проблему безопасности. Система должна не просто понять запрос, но и принять решение: выполнить команду, отказать, уточнить, запросить подтверждение, передать управление человеку или активировать аварийный режим. До сих пор не существовало бенчмарков, изолирующих это решение по роли говорящего, статусу аутентификации, состоянию автомобиля и доступности инструментов.
Методология и результаты
Авторы представили бенчмарк из 202 сценариев с эталонными решениями, разделенными на 7 классов. Были протестированы две локальные модели с открытым весом и три API-модели. Ключевая метрика — Decision Alignment (совпадение решений с эталоном). Результаты показали значительный разрыв между локальными и облачными решениями:
| Модель | Тип | Decision Alignment |
|---|---|---|
| Gemini 3.1 Pro Preview | API | 89.1% |
| Другие API-модели | API | 83.2% – 89.1% |
| Llama 3.2 3B | Локальная | 40.1% |
Хотя API-модели показали статистически значимое превосходство, они не идеальны. В 161 сценарии, где выполнение команды было запрещено, модели допустили 2–3 ложных срабатывания (False Executes). Также сохраняются ошибки в решениях о необходимости подтверждения или переходе на ручное управление.
Эксперименты с Llama 3.2 3B
Авторы провели абляцию для локальной модели Llama 3.2 3B, внедрив структурированную политику авторизации. Это повысило точность с базовых 28.2–29.2% до 40.1%. Однако даже при таком улучшении модель продолжала допускать ложные выполнения опасных команд, что делает ее непригодной для использования в качестве единственного защитного механизма.
Вывод: нужен независимый слой
Исследование доказывает, что структурированные решения LLM недостаточны для обеспечения безопасности в автомобиле. Развертывание таких систем требует наличия независимого слоя enforcement (принуждения), который будет верифицировать права доступа к инструментам и ограничения состояния автомобиля до вызова любой функции. LLM должна оставаться лишь «интерпретатором намерений», а не «исполнителем».
Источник: arXiv cs.AI ↗
