Отказ от сложной архитектуры в пользу «языка»
Современные AI-агенты обычно строятся вокруг сложного цикла (agent loop), требующего интеграции внешних систем памяти, файловой системы и набора жестко заданных инструментов. Авторы новой работы из arXiv (22 сентября 2026 г.) предлагают радикально упростить эту архитектуру. Они создали фреймворк JAZ (JAZ as a Language), который сводит взаимодействие агента к одной примитивной функции — invoke.
Суть подхода: invoke рассматривается не как вызов API, а как языковая конструкция. Каждый раз, когда LLM вызывает эту функцию, она получает доступ ко всей истории взаимодействий и входным данным как к переменным в коде. LLM может писать произвольный исполняемый код, включая рекурсивные вызовы invoke, тем самым самостоятельно управляя логикой работы, памятью и улучшением своих навыков без ручного программирования хуков.
Результаты бенчмарков: JAZ против лидеров рынка
Ключевое преимущество JAZ — отсутствие необходимости в ручном дизайне инструментов или внешних системах памяти. При тестировании на задачах, требующих долгих горизонтов планирования (long-horizon workflows) и самообучения, минималистичный подход показал превосходство над специализированными решениями.
| Метрика / Задача | Сравниваемая система | Результат JAZ | Примечание |
|---|---|---|---|
| Recall (память) | Letta (MemGPT) | +8% точность | На части датасета StuLife, требующей запоминания за пределами контекстного окна |
| Стоимость | Letta (MemGPT) | В 2 раза дешевле | При выполнении тех же задач на StuLife |
| Continual Self-Improvement | ACE | +4% точность | На датасете AppWorld (непрерывное улучшение агента) |
| Стоимость | ACE | Ниже | При выполнении задач на AppWorld |
Почему это важно для индустрии
Работа демонстрирует, что «умные» агенты не требуют громоздких инфраструктурных надстроек. Если LLM может генерировать код, который сам управляет своей памятью и логикой через рекурсивные вызовы, необходимость в отдельных модулях для управления контекстом (как в MemGPT) или внешними инструментами отпадает. Это открывает путь к созданию более дешевых, масштабируемых и гибких AI-систем, где сложность логики определяется не архитектурой фреймворка, а способностями самой модели.
Бенчмарки
| Бенчмарк | JAZ invoke | ACE | Letta (MemGPT) |
|---|---|---|---|
| StuLife (recall-heavy portion) | 8% | — | 0% |
| AppWorld | 4% | 0% | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: arXiv cs.AI ↗
