Проблема плоских библиотек навыков
Большинство современных веб-агентов учатся выполнять задачи изолированно, забывая накопленный опыт. Существующие решения с «библиотеками навыков» часто представляют собой плоский кэш промптов, который не умеет сжимать дубликаты или комбинировать действия рекурсивно. Это ограничивает способность агента адаптироваться к сложным интерфейсам.
Архитектура SCAFFOLD
Новая система SCAFFOLD (Self-Improving Web Agents via Recursive Parametric Skill Abstraction) решает эти проблемы через четыре ключевых механизма:
- Параметрическая абстракция: навыки извлекаются из успешных траекторий с учетом ограничений многоэкземплярной абстракции.
- Рекурсивная иерархия: создается структура, где высокоуровневые навыки вызывают низкоуровневые, а не просто хранятся в списке.
- Сжатие по MDL: библиотека оптимизируется по критерию минимальной длины описания (Minimum Description Length) и проверке поведенческого эквивалентности, удаляя лишнее.
- Дистилляция в веса: периодическое «вплетение» опыта обратно в веса модели для глубокого усвоения абстракций.
Результаты на бенчмарках
Тестирование проводилось на наборах данных WebArena, VisualWebArena и выделенной части Online-Mind2Web. SCAFFOLD демонстрирует стабильный рост (monotonic gains) на протяжении пяти итераций самоусовершенствования без коллапса библиотеки навыков.
| Бенчмарк | Метрика | Результат SCAFFOLD | Прирост над лучшим базовым уровнем |
|---|---|---|---|
| WebArena | Success Rate | — | +11.1 — 17.2 п.п. |
| VisualWebArena | Success Rate | — | +11.1 — 17.2 п.п. |
| Online-Mind2Web | Success Rate | — | +11.1 — 17.2 п.п. |
Значение для индустрии
Работа, принятая к публикации в EMNLP 2026, закладывает фундамент для создания автономных агентов, которые действительно «учатся на ошибках» и становятся эффективнее со временем, а не требуют переобучения с нуля. Код и документация опубликованы в открытом доступе.
Источник: arXiv cs.AI ↗
