Исследования10 сентября 2026 г., 10:17 МСК🤖 Auto

SCAFFOLD: веб-агенты с рекурсивным обучением и ростом на 17%

Исследователи представили SCAFFOLD — систему веб-агентов, которая не просто выполняет задачи, а рекурсивно абстрагирует навыки, сжимая их и улучшая свои веса. Прирост успешности до 17.2% на бенчмарках.

Баннер новости 7153

Проблема плоских библиотек навыков

Большинство современных веб-агентов учатся выполнять задачи изолированно, забывая накопленный опыт. Существующие решения с «библиотеками навыков» часто представляют собой плоский кэш промптов, который не умеет сжимать дубликаты или комбинировать действия рекурсивно. Это ограничивает способность агента адаптироваться к сложным интерфейсам.

Архитектура SCAFFOLD

Новая система SCAFFOLD (Self-Improving Web Agents via Recursive Parametric Skill Abstraction) решает эти проблемы через четыре ключевых механизма:

  • Параметрическая абстракция: навыки извлекаются из успешных траекторий с учетом ограничений многоэкземплярной абстракции.
  • Рекурсивная иерархия: создается структура, где высокоуровневые навыки вызывают низкоуровневые, а не просто хранятся в списке.
  • Сжатие по MDL: библиотека оптимизируется по критерию минимальной длины описания (Minimum Description Length) и проверке поведенческого эквивалентности, удаляя лишнее.
  • Дистилляция в веса: периодическое «вплетение» опыта обратно в веса модели для глубокого усвоения абстракций.

Результаты на бенчмарках

Тестирование проводилось на наборах данных WebArena, VisualWebArena и выделенной части Online-Mind2Web. SCAFFOLD демонстрирует стабильный рост (monotonic gains) на протяжении пяти итераций самоусовершенствования без коллапса библиотеки навыков.

Бенчмарк Метрика Результат SCAFFOLD Прирост над лучшим базовым уровнем
WebArena Success Rate +11.1 — 17.2 п.п.
VisualWebArena Success Rate +11.1 — 17.2 п.п.
Online-Mind2Web Success Rate +11.1 — 17.2 п.п.

Значение для индустрии

Работа, принятая к публикации в EMNLP 2026, закладывает фундамент для создания автономных агентов, которые действительно «учатся на ошибках» и становятся эффективнее со временем, а не требуют переобучения с нуля. Код и документация опубликованы в открытом доступе.

Источник: arXiv cs.AI ↗