Автоматизация сложных задач в интернете с помощью веб-агентов (web agents) сталкивается с серьезной экономической проблемой: использование мощных проприетарных моделей для онлайн-адаптации локальных моделей слишком дорого. Команда исследователей во главе с Цзяньвэем Чжаном (Jianwei Zhang) предложила решение — Budget-Aware Online Adaptation, которое оптимизирует процесс обучения, отвечая на два ключевых вопроса: когда запрашивать помощь у сильной модели и что именно сохранять для обучения.
Проблема стандартных подходов
Традиционные методы оптимизации предпочтений на уровне траектории (trajectory-level preference optimization) неэффективны. Они тратят бюджет на два типа «мусорных» данных:
- Нерешаемые эпизоды: задачи, которые агент не может выполнить независимо, но система все равно пытается обучать на них.
- Избыточные ходы: шаги в траектории, которые не несут полезной информации для улучшения модели.
Решение: Score-Guided Online Teaching
Предложенная архитектура внедряет два механизма контроля:
- Solvability-aware teacher gate: «Ворота», которые решают, когда стоит обращаться к учителю. Если задача решаемая локально, дорогой запрос пропускается.
- Score-guided turn selection: Механизм отбора, который определяет, что учить. Из полной траектории сохраняются только информативные ходы, отсеивая шум.
Результаты и метрики
Эксперименты проводились на бенчмарках MiniWoB и TimeWarp. Метод демонстрирует сопоставимую с базовыми подходами точность первого прохода (first-pass success), но при этом значительно снижает ресурсоемкость.
| Метрика | Результат оптимизации | Значение для бизнеса |
|---|---|---|
| Снижение запросов к учителю | 22.6% | Прямая экономия на API-вызовах дорогих моделей |
| Снижение вычислений для обучения | 52.1% | Ускорение итераций и снижение затрат на GPU |
Код реализации метода уже доступен, что открывает возможности для внедрения экономичных веб-агентов в коммерческие продукты без катастрофического роста операционных расходов.
Источник: arXiv cs.AI ↗
