Проблема «короткой памяти» в долгосрочных задачах
Современные LLM-агенты сталкиваются с фундаментальным ограничением: их контекстное окно и время сессии короче, чем длительность реальных задач, таких как оперативное устранение неполадок или долгосрочные исследовательские программы. Авторы статьи (Erik Nijkamp, Anurag Koul, Egor Pakhomov, Bo Pang) утверждают, что для работы в режиме long-horizon агент должен не просто помнить, но и не забывать до того, как начнет учиться. Ключевая идея заключается в том, что эта способность обеспечивается не самой моделью, а «обвязкой» (harness) вокруг нее.
Три столпа архитектуры: Levels, Ticks, Cascaded
Команда выделила семь узких мест (bottlenecks) долгосрочного взаимодействия и предложила иерархическую структуру из трех компонентов для их решения:
- Levels (Уровни): Иерархия, индексированная по временной шкале. Каждый уровень хранит ограниченный файл-резюме, суммирующий работу уровня ниже.
- Ticks (Тики): Единица автономного действия, синхронизированная с часами. Это позволяет агенту действовать автономно в заданные интервалы.
- Cascaded Intelligence (Каскадный интеллект): Механизм эскалации. Задача передается более мощной модели только в том случае, если текущая модель не проходит проверку (review).
Результаты 10-дневного эксперимента
Авторы провели кампанию длительностью 10 дней, в ходе которой агент на базе предложенной архитектуры воспроизвел опубликованный результат обучения с подкреплением (reinforcement learning). Человек участвовал в процессе всего один раз в день. Эксперимент подтвердил три ключевых факта:
- Агент сохранил нить рассуждений (thread) через все сбросы контекста и границы сессий.
- Знания, записанные в начале работы, влияли на поведение агента в конце, без необходимости изменения весов модели (weights).
- Определены места, где такие системы могут интегрировать компоненты обучения.
Почему это важно
Результаты показывают, что для истинного непрерывного обучения (continual learning) агентам необходима подложка (substrate), переживающая любой контекст и процесс. Проверки, которые уже выполняет «обвязка», становятся естественным местом для внедрения механизмов обучения, что открывает путь к созданию автономных систем, способных работать неделями без деградации качества.
Источник: arXiv cs.AI ↗
