Проблема самообучения навыков
Создание переносимых пакетов инструкций (навыков) для AI-агентов сталкивается с двумя критическими барьерами. Во-первых, навыки, сгенерированные с нуля, часто уступают человеческим кураторским наборам, а на слабых моделях их отсутствие может быть выгоднее. Во-вторых, традиционные методы эволюции фиксируют лишь один успешный траекторию, который стохастический агент при повторном запуске в новой среде часто не может воспроизвести.
Архитектура reSolve: Solve-and-Reproduce
Исследователи во главе с Цзялэем Лю (Jiale Liu) представили фреймворк reSolve, который решает эти проблемы через механизм solve-and-reproduce (реши и воспроизведи). Ключевые компоненты системы:
- Разделение процессов: Интерактивное решение задачи отделено от создания самодостаточного результата, который затем независимо выполняется в новом контейнере.
- Суррогатный верификатор: Используется модель-проверитель, которая не имеет доступа к скрытым тестам или эталонным ответам, но усиливает разреженный сигнал награды.
- Beam Search: Поиск с пучком (beam search) над графом построения решений, направляемый верификатором.
Результаты и бенчмарки
Эксперименты показали, что даже дешевая модель, использующая reSolve, способна значительно превзойти человеческие базы знаний. Ниже приведено сравнение ключевых метрик:
| Метрика / Модель | Результат | Примечание |
|---|---|---|
| reSolve (mean-of-3) | 74.9% | Результат самообучающейся модели |
| Человеческая база (baseline) | 60.1% | Кураторские навыки |
| GPT-5.5 / OpenHands | 67.3% | Сильнейший официальный результат |
| Прирост над baseline | +14.8 п. | Относительно человеческих навыков |
Значение для индустрии
Достигнутый результат в 74.9% демонстрирует, что автономная эволюция навыков может превзойти не только слабые модели, но и передовые проприетарные решения, такие как GPT-5.5 в связке с OpenHands. Исследование также включает анализ отказов и результаты на 14 задачах из области естественных наук, что помогает определить границы применимости подхода. Это открывает путь к созданию самообучающихся агентов, способных адаптироваться к новым задачам без постоянного вмешательства человека.
Источник: arXiv cs.AI ↗
