Исследования1 сентября 2026 г., 10:20 МСК🤖 Auto

reSolve: ИИ-агент эволюционирует навыки, обгоняя GPT-5.5

Новая архитектура reSolve позволяет дешевым моделям самостоятельно создавать и улучшать навыки, достигая 74.9% точности и превосходя сильные проприетарные решения.

Баннер новости 6478

Проблема самообучения навыков

Создание переносимых пакетов инструкций (навыков) для AI-агентов сталкивается с двумя критическими барьерами. Во-первых, навыки, сгенерированные с нуля, часто уступают человеческим кураторским наборам, а на слабых моделях их отсутствие может быть выгоднее. Во-вторых, традиционные методы эволюции фиксируют лишь один успешный траекторию, который стохастический агент при повторном запуске в новой среде часто не может воспроизвести.

Архитектура reSolve: Solve-and-Reproduce

Исследователи во главе с Цзялэем Лю (Jiale Liu) представили фреймворк reSolve, который решает эти проблемы через механизм solve-and-reproduce (реши и воспроизведи). Ключевые компоненты системы:

  • Разделение процессов: Интерактивное решение задачи отделено от создания самодостаточного результата, который затем независимо выполняется в новом контейнере.
  • Суррогатный верификатор: Используется модель-проверитель, которая не имеет доступа к скрытым тестам или эталонным ответам, но усиливает разреженный сигнал награды.
  • Beam Search: Поиск с пучком (beam search) над графом построения решений, направляемый верификатором.

Результаты и бенчмарки

Эксперименты показали, что даже дешевая модель, использующая reSolve, способна значительно превзойти человеческие базы знаний. Ниже приведено сравнение ключевых метрик:

Метрика / Модель Результат Примечание
reSolve (mean-of-3) 74.9% Результат самообучающейся модели
Человеческая база (baseline) 60.1% Кураторские навыки
GPT-5.5 / OpenHands 67.3% Сильнейший официальный результат
Прирост над baseline +14.8 п. Относительно человеческих навыков

Значение для индустрии

Достигнутый результат в 74.9% демонстрирует, что автономная эволюция навыков может превзойти не только слабые модели, но и передовые проприетарные решения, такие как GPT-5.5 в связке с OpenHands. Исследование также включает анализ отказов и результаты на 14 задачах из области естественных наук, что помогает определить границы применимости подхода. Это открывает путь к созданию самообучающихся агентов, способных адаптироваться к новым задачам без постоянного вмешательства человека.

Источник: arXiv cs.AI ↗