Проблема «узкого горлышка» в обучении агентов
Обучение инструментовых агентов (tool-use agents) улучшать свои навыки на собственном опыте остается одной из самых сложных задач в AI. Традиционный подход, основанный на контролируемой тонкой настройке (SFT), зависит от фиксированных траекторий, дистиллированных более мощными моделями-учителями. С другой стороны, обучение с подкреплением (RL) с разреженными наградами дает слабое руководство для долгосрочных взаимодействий, где ошибка на первом шаге может привести к провалу всего сценария.
Команда исследователей во главе с Синью Гэнгом (Xinyu Geng) предлагает решение: DeepSearch-Evolve. Это фреймворк самодистилляции, который позволяет агентам эволюционировать без внешнего учителя, опираясь на детерминированную и верифицируемую среду DeepSearch-World.
DeepSearch-World: 420K задач и верифицируемость
Ключевым нововведением является не только алгоритм, но и среда. DeepSearch-World содержит пул из 420 000 многошаговых задач QA (вопрос-ответ), сгенерированных через случайные блуждания на уровне сущностей. Среда обеспечивает воспроизводимость поиска и чтения страниц, что критически важно для оценки.
Среда поддерживает три ключевые когнитивные функции для саморазвития:
- Progress Verification: Проверка прогресса на каждом шаге.
- Grounded Reflection: Рефлексия, основанная на конкретных фактах из найденных данных.
- Failure Recovery: Способность восстанавливаться после ошибок в цепочке рассуждений.
Результаты: 9B модель против закрытых аналогов
Без использования дистилляции от более мощных моделей, обученная на DeepSearch-World модель DeepSearch-World-9B продемонстрировала конкурентоспособные результаты на сложных бенчмарках. Это доказывает, что верифицируемая среда позволяет масштабировать саморазвитие агентов для долгосрочных веб-задач.
| Бенчмарк | Результат DeepSearch-World-9B | Значение |
|---|---|---|
| HotpotQA | 93.4% | Высокая точность на многошаговых вопросах |
| GAIA | 61.5% | Конкурентный результат на общих задачах AI |
| BrowseComp | 31.2% | Показатель способности к глубокому поиску |
Итеративный процесс эволюции
Процесс обучения DeepSearch-Evolve не是一次性, а итеративный. Он включает четыре этапа:
- Генерация траекторий агентом.
- Фильтрация некачественных или ошибочных путей.
- Смешивание данных (data mixing) для баланса сложности.
- Тонкая настройка (fine-tuning) модели на отфильтрованных данных.
Исследователи опубликуют среду, набор из 420K тренировочных данных, валидационный набор, код и веса модели, чтобы стимулировать развитие самосовершенствующихся веб-агентов в open-source сообществе.
Источник: arXiv cs.CL ↗
