Исследования2 сентября 2026 г., 05:17 МСК🤖 Auto

Test-Time Scaling: как масштабирование вычислений ускоряет поиск научных формул

Исследование Haowei Lin и коллег (arXiv:2608.28660) показывает, что для LLM-открытия уравнений критически важна ширина поиска (search width), а не сложные промпты.

Баннер новости 6552

Проблема открытых задач

Методы Test-Time Scaling (TTS) уже доказали эффективность в закрытых задачах, таких как математика и программирование, где есть четкий ответ. Однако автоматическое открытие научных уравнений — это open-ended задача: модель должна генерировать кандидаты, проверять их по данным и итеративно улучшать. Авторы работы из Microsoft Research (Haowei Lin, Hubert Lim, Xiangyu Wang, Letian Huang, Di He) решили унифицировать подходы Best-of-N, последовательного уточнения, поиска по дереву и эволюционных алгоритмов в единую систему распределения вычислений.

Ключевой инсайт: ширина поиска (Search Width)

Исследователи провели бенчмарк на наборе данных LLM-SRBench, изолировав влияние распределения вычислений от качества промптов. Главный вывод: ширина поиска (search width) является доминирующим параметром. Оптимальная ширина растет вместе с доступным бюджетом вычислений. Выбор стратегии ветвления (population-branching split) и контроллера оказался второстепенным фактором.

Результаты и метрики

Правильный выбор ширины не только повышает точность, но и улучшает эффективность по времени (wall-clock efficiency) за счет увеличения параллелизма. Ниже приведена сравнительная логика распределения ресурсов, выявленная в исследовании:

Параметр Влияние на результат Комментарий исследователей
Search Width Высокое (Доминирующий фактор) Увеличение ширины пропорционально бюджету вычислений дает лучший прирост точности.
Controller Choice Низкое Выбор между минимальными параллельными контроллерами не дает значимого преимущества.
Population-Branching Split Низкое Баланс между популяцией и ветвлением менее важен, чем общий объем параллельных проверок.
Wall-Clock Efficiency Положительная корреляция Высокая параллельность (широкий поиск) ускоряет получение результата.

Почему это важно для науки

Работа, принятая к публикации в EMNLP 2026, меняет парадигму использования LLM в науке. Вместо того чтобы тратить ресурсы на тонкую настройку промптов или сложные эвристики, разработчикам стоит сосредоточиться на создании информативных верификаторов и управлении балансом между исследованием (exploration) и использованием (exploitation). Это открывает путь к более быстрому открытию новых физических и химических законов с помощью ИИ.

Источник: arXiv cs.CL ↗