Исследования19 сентября 2026 г., 06:17 МСК🤖 Auto

LLM в авто: 89% точности, но риск ложных срабатываний

Исследование arXiv показало, что даже топовые LLM допускают критические ошибки при авторизации голосовых команд в автомобилях, требуя независимого слоя безопасности.

Баннер новости 7851

Проблема: от намерения к действию

Интеграция больших языковых моделей (LLM) в голосовых помощниках автомобилей создает критическую проблему безопасности. Система должна не просто понять запрос, но и принять решение: выполнить команду, отказать, уточнить, запросить подтверждение, передать управление человеку или активировать аварийный режим. До сих пор не существовало бенчмарков, изолирующих это решение по роли говорящего, статусу аутентификации, состоянию автомобиля и доступности инструментов.

Методология и результаты

Авторы представили бенчмарк из 202 сценариев с эталонными решениями, разделенными на 7 классов. Были протестированы две локальные модели с открытым весом и три API-модели. Ключевая метрика — Decision Alignment (совпадение решений с эталоном). Результаты показали значительный разрыв между локальными и облачными решениями:

Модель Тип Decision Alignment
Gemini 3.1 Pro Preview API 89.1%
Другие API-модели API 83.2% – 89.1%
Llama 3.2 3B Локальная 40.1%

Хотя API-модели показали статистически значимое превосходство, они не идеальны. В 161 сценарии, где выполнение команды было запрещено, модели допустили 2–3 ложных срабатывания (False Executes). Также сохраняются ошибки в решениях о необходимости подтверждения или переходе на ручное управление.

Эксперименты с Llama 3.2 3B

Авторы провели абляцию для локальной модели Llama 3.2 3B, внедрив структурированную политику авторизации. Это повысило точность с базовых 28.2–29.2% до 40.1%. Однако даже при таком улучшении модель продолжала допускать ложные выполнения опасных команд, что делает ее непригодной для использования в качестве единственного защитного механизма.

Вывод: нужен независимый слой

Исследование доказывает, что структурированные решения LLM недостаточны для обеспечения безопасности в автомобиле. Развертывание таких систем требует наличия независимого слоя enforcement (принуждения), который будет верифицировать права доступа к инструментам и ограничения состояния автомобиля до вызова любой функции. LLM должна оставаться лишь «интерпретатором намерений», а не «исполнителем».

Источник: arXiv cs.AI ↗