Проблема открытых задач
Методы Test-Time Scaling (TTS) уже доказали эффективность в закрытых задачах, таких как математика и программирование, где есть четкий ответ. Однако автоматическое открытие научных уравнений — это open-ended задача: модель должна генерировать кандидаты, проверять их по данным и итеративно улучшать. Авторы работы из Microsoft Research (Haowei Lin, Hubert Lim, Xiangyu Wang, Letian Huang, Di He) решили унифицировать подходы Best-of-N, последовательного уточнения, поиска по дереву и эволюционных алгоритмов в единую систему распределения вычислений.
Ключевой инсайт: ширина поиска (Search Width)
Исследователи провели бенчмарк на наборе данных LLM-SRBench, изолировав влияние распределения вычислений от качества промптов. Главный вывод: ширина поиска (search width) является доминирующим параметром. Оптимальная ширина растет вместе с доступным бюджетом вычислений. Выбор стратегии ветвления (population-branching split) и контроллера оказался второстепенным фактором.
Результаты и метрики
Правильный выбор ширины не только повышает точность, но и улучшает эффективность по времени (wall-clock efficiency) за счет увеличения параллелизма. Ниже приведена сравнительная логика распределения ресурсов, выявленная в исследовании:
| Параметр | Влияние на результат | Комментарий исследователей |
|---|---|---|
| Search Width | Высокое (Доминирующий фактор) | Увеличение ширины пропорционально бюджету вычислений дает лучший прирост точности. |
| Controller Choice | Низкое | Выбор между минимальными параллельными контроллерами не дает значимого преимущества. |
| Population-Branching Split | Низкое | Баланс между популяцией и ветвлением менее важен, чем общий объем параллельных проверок. |
| Wall-Clock Efficiency | Положительная корреляция | Высокая параллельность (широкий поиск) ускоряет получение результата. |
Почему это важно для науки
Работа, принятая к публикации в EMNLP 2026, меняет парадигму использования LLM в науке. Вместо того чтобы тратить ресурсы на тонкую настройку промптов или сложные эвристики, разработчикам стоит сосредоточиться на создании информативных верификаторов и управлении балансом между исследованием (exploration) и использованием (exploitation). Это открывает путь к более быстрому открытию новых физических и химических законов с помощью ИИ.
Источник: arXiv cs.CL ↗
