Исследования18 сентября 2026 г., 11:18 МСК🤖 Auto

Long-Horizon Agents: Архитектура для работы без забвения

Исследователи представили иерархическую архитектуру для AI-агентов, способных вести непрерывную работу неделями, сохраняя контекст и обучаясь на опыте без изменения весов модели.

Баннер новости 7782

Проблема «короткой памяти» в долгосрочных задачах

Современные LLM-агенты сталкиваются с фундаментальным ограничением: их контекстное окно и время сессии короче, чем длительность реальных задач, таких как оперативное устранение неполадок или долгосрочные исследовательские программы. Авторы статьи (Erik Nijkamp, Anurag Koul, Egor Pakhomov, Bo Pang) утверждают, что для работы в режиме long-horizon агент должен не просто помнить, но и не забывать до того, как начнет учиться. Ключевая идея заключается в том, что эта способность обеспечивается не самой моделью, а «обвязкой» (harness) вокруг нее.

Три столпа архитектуры: Levels, Ticks, Cascaded

Команда выделила семь узких мест (bottlenecks) долгосрочного взаимодействия и предложила иерархическую структуру из трех компонентов для их решения:

  • Levels (Уровни): Иерархия, индексированная по временной шкале. Каждый уровень хранит ограниченный файл-резюме, суммирующий работу уровня ниже.
  • Ticks (Тики): Единица автономного действия, синхронизированная с часами. Это позволяет агенту действовать автономно в заданные интервалы.
  • Cascaded Intelligence (Каскадный интеллект): Механизм эскалации. Задача передается более мощной модели только в том случае, если текущая модель не проходит проверку (review).

Результаты 10-дневного эксперимента

Авторы провели кампанию длительностью 10 дней, в ходе которой агент на базе предложенной архитектуры воспроизвел опубликованный результат обучения с подкреплением (reinforcement learning). Человек участвовал в процессе всего один раз в день. Эксперимент подтвердил три ключевых факта:

  1. Агент сохранил нить рассуждений (thread) через все сбросы контекста и границы сессий.
  2. Знания, записанные в начале работы, влияли на поведение агента в конце, без необходимости изменения весов модели (weights).
  3. Определены места, где такие системы могут интегрировать компоненты обучения.

Почему это важно

Результаты показывают, что для истинного непрерывного обучения (continual learning) агентам необходима подложка (substrate), переживающая любой контекст и процесс. Проверки, которые уже выполняет «обвязка», становятся естественным местом для внедрения механизмов обучения, что открывает путь к созданию автономных систем, способных работать неделями без деградации качества.

Источник: arXiv cs.AI ↗