Исследования11 июля 2026 г., 02:16 МСК🤖 Auto

DeepSearch-World: Самообучение агентов без учителя достигло 93.4% на HotpotQA

Исследователи представили DeepSearch-Evolve — фреймворк для самодистилляции веб-агентов в верифицируемой среде. Модель 9B параметров показала результаты, сопоставимые с закрытыми аналогами, используя только 420K собственных траекторий.

Баннер новости 3344

Проблема «узкого горлышка» в обучении агентов

Обучение инструментовых агентов (tool-use agents) улучшать свои навыки на собственном опыте остается одной из самых сложных задач в AI. Традиционный подход, основанный на контролируемой тонкой настройке (SFT), зависит от фиксированных траекторий, дистиллированных более мощными моделями-учителями. С другой стороны, обучение с подкреплением (RL) с разреженными наградами дает слабое руководство для долгосрочных взаимодействий, где ошибка на первом шаге может привести к провалу всего сценария.

Команда исследователей во главе с Синью Гэнгом (Xinyu Geng) предлагает решение: DeepSearch-Evolve. Это фреймворк самодистилляции, который позволяет агентам эволюционировать без внешнего учителя, опираясь на детерминированную и верифицируемую среду DeepSearch-World.

DeepSearch-World: 420K задач и верифицируемость

Ключевым нововведением является не только алгоритм, но и среда. DeepSearch-World содержит пул из 420 000 многошаговых задач QA (вопрос-ответ), сгенерированных через случайные блуждания на уровне сущностей. Среда обеспечивает воспроизводимость поиска и чтения страниц, что критически важно для оценки.

Среда поддерживает три ключевые когнитивные функции для саморазвития:

  • Progress Verification: Проверка прогресса на каждом шаге.
  • Grounded Reflection: Рефлексия, основанная на конкретных фактах из найденных данных.
  • Failure Recovery: Способность восстанавливаться после ошибок в цепочке рассуждений.

Результаты: 9B модель против закрытых аналогов

Без использования дистилляции от более мощных моделей, обученная на DeepSearch-World модель DeepSearch-World-9B продемонстрировала конкурентоспособные результаты на сложных бенчмарках. Это доказывает, что верифицируемая среда позволяет масштабировать саморазвитие агентов для долгосрочных веб-задач.

Бенчмарк Результат DeepSearch-World-9B Значение
HotpotQA 93.4% Высокая точность на многошаговых вопросах
GAIA 61.5% Конкурентный результат на общих задачах AI
BrowseComp 31.2% Показатель способности к глубокому поиску

Итеративный процесс эволюции

Процесс обучения DeepSearch-Evolve не是一次性, а итеративный. Он включает четыре этапа:

  1. Генерация траекторий агентом.
  2. Фильтрация некачественных или ошибочных путей.
  3. Смешивание данных (data mixing) для баланса сложности.
  4. Тонкая настройка (fine-tuning) модели на отфильтрованных данных.

Исследователи опубликуют среду, набор из 420K тренировочных данных, валидационный набор, код и веса модели, чтобы стимулировать развитие самосовершенствующихся веб-агентов в open-source сообществе.

Источник: arXiv cs.CL ↗