Исследования30 сентября 2026 г., 08:17 МСК🤖 Auto

Больше программ или больше попыток? Как LLM-хarnessы скрывают реальный прогресс

Исследование arXiv:2609.35873 доказывает, что автоматическая генерация LLM-хarnessов часто дает иллюзию улучшения за счет простого повторения одних и тех же программ, а не истинной специализации.

Баннер новости 8572

Проблема: Иллюзия специализации

Автоматическая генерация LLM-хarnessов (наборов программ для улучшения вывода моделей) позиционируется как способ повышения точности через узкую специализацию. Однако исследователи из команды Ziyang Xu выявили критический методологический дефект: улучшение результатов часто достигается не за счет уникальных решений, а за счет многократного выполнения одних и тех же программ. Это создает ложное впечатление о «специализации», маскируя отсутствие реального прогресса в решении новых задач.

Методология: Контролируемый эксперимент на MATH-500

Для разделения понятий «охват ответов» (coverage) и «специализация» (specialization) команда провела строгий бенчмарк на 386 задачах набора MATH-500. В эксперименте сравнивались:

  • 8 сгенерированных хarnessей (автоматически созданных программ).
  • Базовая линия (baseline), состоящая из 9 идентичных копий для оценки стабильности.
  • Режим выполнения: каждое решение запускалось ровно 3 раза для анализа повторяемости результатов.

Ключевые метрики и результаты

Анализ показал, что сгенерированные программы демонстрируют высокую повторяемость, но эта повторяемость чаще указывает на устойчивые ошибки, чем на успехи. Ниже приведены сравнительные данные эффективности подходов:

Метрика / Показатель Значение / Наблюдение Интерпретация
Повторяемый оракульный потенциал (Repeat-averaged oracle headroom) +2.16 п.п. Разница в потенциале между идентичными программами и базовой линией.
Устойчивые проигрыши (Persistent losses) 100 задач На этих задачах сгенерированные программы проигрывают базовой линии во всех 3 запусках.
Устойчивые победы (Persistent wins) 1 задача Лишь одна задача показала стабильное преимущество, причем результат был чувствителен к извлечению ответа.
Вклад замороженного селектора (Frozen selector gain) 0.00 п.п. Механизм выбора программ не дал прироста точности.
Охват оракула (Oracle coverage) 98.70% Достигается при 27 выполнениях хarnessей, но не гарантирует полезной специализации.

Причины неудач: Механизмы, а не данные

Анализ трассировок BIRD (BIRD dataset traces) позволил локализовать корень проблем. Ошибки в сгенерированных хarnessах связаны не с недостатком данных, а с техническими сбоями на уровне:

  • Реализации механизмов (mechanism implementation).
  • Активации компонентов (activation).
  • Валидности выходных данных (output validity).

Вывод: Новый стандарт оценки

Исследование ставит точку в аргументе, что простой рост охвата или повторяемости оправдывает использование сложных LLM-хarnessей. Авторы предлагают новый стандарт оценки разнообразия: истинная специализация должна проявляться в устойчивых преимуществах на разных запусках, помогать в принятии решений и улучшать результаты при фиксированном бюджете вычислений, а не просто дублировать успехи базовой модели.

Источник: arXiv cs.AI ↗