Проблема неконтролируемых агентов
Современные LLM-агенты всё чаще действуют как полноценные исполнительные системы: они вызывают инструменты, изменяют локальное состояние, используют постоянную память и взаимодействуют с внешними протоколами. Однако эта мощь несет серьезные риски: от привилегированных действий и инъекций в промпты до отравления инструментов и неконтролируемых побочных эффектов. Традиционные подходы часто не обеспечивают достаточной прозрачности и аудита таких процессов.
Архитектура Agentao
Команда авторов (Bo Jin, Qiang Jiao, Xin Tong) предлагает решение под названием Agentao — управляемый локально-ориентированный рантайм. Ключевая инновация заключается в строгом разделении предложений действий, сгенерированных моделью, и их фактического выполнения, авторизованного хостом. Система построена на многоуровневой архитектуре:
- Поверхности, ориентированные на хост;
- Контракт хоста;
- Ядро рантайма;
- Система инструментов с опосредованными разрешениями;
- Подсистемы памяти, воспроизведения, плагинов, навыков, суб-агентов и интеграции протоколов.
Модель безопасности и аудита
Agentao не претендует на формальные гарантии безопасности, но демонстрирует, как разрешения, состояние, границы протоколов и журналы выполнения могут стать явными абстракциями рантайма. Это делает агентов более управляемыми и пригодными для сред, контролируемых хостом. Система предоставляет структурированный интерфейс событий, позволяющий отслеживать каждое действие агента.
Сравнительные характеристики подхода
| Критерий | Традиционные LLM-агенты | Agentao |
|---|---|---|
| Исполнение действий | Прямое, часто без фильтрации | Разделено: генерация vs авторизация хостом |
| Аудируемость | Слабая, часто отсутствует | Высокая, через структурированные события |
| Безопасность | Уязвимость к инъекциям и отравлению | Защита через систему разрешений и границы протоколов |
| Локальность | Часто облачно-зависимые | Local-first (приоритет локального выполнения) |
Доступность и статус
Код проекта уже опубликован на GitHub. Авторы отмечают, что в настоящее время ведутся тестирование и анализ фреймворка. Ожидаемые экспериментальные результаты и примеры использования будут добавлены в будущих версиях. Статья подана в arXiv 4 июля 2026 года.
Источник: arXiv cs.AI ↗
