Исследования18 августа 2026 г., 08:17 МСК🤖 Auto

Безопасность LLM-агентов: систематический обзор 38 исследований

Исследователи провели PRISMA-анализ 38 работ (2022–2026 гг.), выявив критический разрыв между спецификацией, верификацией и обеспечением безопасности планов LLM-агентов.

Баннер новости 5970

Проблема необратимых действий

LLM-агенты всё чаще переходят от генерации текста к выполнению реальных действий: обновлению баз данных, вызовам API, работе с файлами и автономному использованию инструментов. Ключевая проблема заключается в отсутствии формально обоснованных гарантий безопасности на уровне планов, которые генерируют модели. Существующие системы не могут гарантировать, что агент не нанесет вред в реальном мире.

Методология и охват исследования

Авторы статьи arXiv:2608.14590 провели систематический обзор по методологии PRISMA 2020. В выборку вошли 38 научных работ, опубликованных в период с 2022 по 2026 год. Исследование фокусируется на трех ключевых аспектах:

  • Спецификация (Specification): как формально описать безопасное поведение агента.
  • Верификация (Verification): как математически или алгоритмически проверить план агента до его выполнения.
  • Обеспечение (Enforcement): как технически ограничить действия агента в реальном времени.

Ключевые выводы: фрагментация подходов

Исследование показало, что научное сообщество рассматривает безопасность LLM-агентов фрагментарно. Большинство подходов решают только одну из трех задач, что ограничивает понимание их сильных и слабых сторон. Отсутствие единой рамки, объединяющей спецификацию, верификацию и enforcement, создает риски для внедрения автономных систем в критически важные сферы.

Значимость для индустрии

Для разработчиков AI-агентов этот обзор служит дорожной картой. Он подчеркивает необходимость перехода от эвристических методов защиты к формальным гарантиям. Без решения проблемы верификации планов на уровне задач, использование LLM-агентов в бизнес-процессах, связанных с изменением данных или управлением системами, останется сопряженным с высокими рисками.

Источник: arXiv cs.AI ↗