От статичной модели к адаптивной системе
Исследователи во главе с Чжэ Жэнь (Zhe Ren) и Юргеном Шмидхубером (Jürgen Schmidhuber) представили фундаментальный обзор, описывающий переход автономных агентов от лабораторных прототипов к развернутым системам. Ключевая идея работы заключается в том, что современный агент — это не просто большая языковая модель (LLM), а конфигурация, сочетающая базовую модель с операционным каркасом (scaffold), включающим промпты, память, инструменты и логику управления.
Авторы формализуют «самоулучшение» как оператор самовызванного обновления, который получает данные из опыта и применяет изменения либо к параметрам модели, либо к компонентам этого каркаса. Главная цель — контролируемая эволюция с минимальным или нулевым вмешательством человека.
Архитектура обновления: что именно меняется?
Обзор структурирует существующие подходы по двум основным критериям: цели обновления (target) и сигналу, который запускает изменение. Это позволяет классифицировать методы от простой оптимизации промптов до тонкой настройки весов нейросети. Ниже приведена классификация уровней самообновления, выделенных в исследовании:
| Уровень обновления | Объект изменения | Примеры механизмов |
|---|---|---|
| Слой промптов | Контекстные инструкции | Автоматическая генерация и отбор лучших промптов (Prompt Evolution) |
| Слой памяти | База знаний агента | Сжатие, фильтрация и обновление векторной базы данных на основе успешных/неудачных действий |
| Слой инструментов | API и внешние функции | Динамическое добавление или удаление доступных инструментов на основе потребностей задачи |
| Слой модели (Weights) | Параметры нейросети | RLHF (обучение с подкреплением от человека), DPO (прямая оптимизация предпочтений), самогенерация данных для дообучения |
Сигналы для обучения: как агент понимает, что улучшился?
Критически важным аспектом обзора является анализ сигналов обратной связи. Исследователи выделяют несколько источников, которые агенты используют для оценки качества своих действий:
- Внутренние сигналы (Self-Reflection): Агент анализирует свои собственные рассуждения (Chain-of-Thought) на наличие логических ошибок или противоречий.
- Внешние сигналы (Environment Feedback): Успех или провал выполнения задачи в среде (например, успешный запуск кода, получение ответа от API).
- Сигналы от других агентов: В мультиагентных системах один агент может оценивать действия другого, создавая систему взаимного улучшения.
Практическое значение и вызовы
Обзор подчеркивает, что хотя технические решения для самообучения существуют, главной проблемой остается контролируемость. Риск «дрейфа» модели (model drift) и накопления ошибок в процессе автономного обучения требует новых методов валидации. Авторы отмечают, что будущее направление — это создание гибридных систем, где критические решения все же требуют человеческого одобрения, а рутинная оптимизация происходит автономно.
Полный текст исследования (97 страниц, 12 иллюстраций) и сопутствующий код доступны на проекте авторов, что делает эту работу важным ресурсом для инженеров, разрабатывающих next-gen AI-агентов.
Источник: arXiv cs.AI ↗
