Традиционные системы оптимизации (промптов, программ или ML-пайплайнов) полагаются на внешние контроллеры: эволюционные алгоритмы, бандиты или методы текстовых градиентов. Авторы новой работы, опубликованной в arXiv (cs.AI) и принятой в COLM 2026, задаются фундаментальным вопросом: можно ли перенести логику поиска внутрь самого агента? Они представляют ReASearch — унифицированный фреймворк, где агент автономно решает, что оценивать, как диагностировать ошибки, какие правки вносить и когда перезапускать процесс.
Как это работает
В отличие от стандартных подходов, где LLM выступает лишь генератором гипотез по заданным правилам, ReASearch использует общий цикл агента с набором специализированных инструментов. Агент обладает «памятью» (persistent memory), что позволяет ему анализировать результаты, распределять вычислительный бюджет и корректировать стратегию на длинной дистанции. Сложное поведение поиска, которое раньше требовало написания сложных внешних контроллеров, теперь естественным образом emerges (возникает) из процесса рассуждения модели.
Результаты и бенчмарки
Эксперименты проводились на 14 разнообразных задачах. ReASearch показал конкурентоспособные результаты, превзойдя специализированные системы оптимизации в большинстве случаев. Прирост эффективности составил от 2% до 40% по сравнению с сильными базовыми линиями (baselines). В некоторых сценариях агент смог найти решения, превосходящие ранее известные человеческие достижения (human best-known results).
| Метрика / Аспект | Результат ReASearch | Сравнение с базовыми линиями |
|---|---|---|
| Диапазон прироста | +2% ... +40% | Превосходство над сильными доменными baselines |
| Количество задач | 14 | Разнообразные домены: промпты, код, ML-пайплайны |
| Качество решений | Human-best | В отдельных случаях найдены решения лучше человеческих |
| Архитектура | Единый скелет (scaffold) | Одна система для всех трех типов оптимизации |
Почему это важно
Работа демонстрирует сдвиг парадигмы: от «инструментального использования LLM» к «агентному управлению процессом». Это снижает необходимость в ручной настройке эвристик для каждой новой задачи. Если агент может сам диагностировать провалы и корректировать стратегию, это открывает путь к полностью автономным системам разработки ПО и настройки ML-моделей, где человек выступает лишь в роли арбитра или постановщика цели.
Источник: arXiv cs.AI ↗
