Исследования4 августа 2026 г., 07:16 МСК🤖 Auto

Дешевые LLM судят математические доказательства лучше Claude Opus 4.7

Исследование показывает, что комбинация из трех открытых моделей (GPT-OSS 120B, DeepSeek-V4 Flash, Gemma-4 31B) оценивает доказательства с точностью, сопоставимой с Claude Opus 4.7, но в 100 раз дешевле.

Баннер новости 5012

Проблема стоимости оценки

Автоматическая оценка математических доказательств на естественном языке — узкое место в тестировании систем математического мышления. Использование передовых (frontier) LLM-судей, таких как Claude Opus 4.7 или Gemini 3.1 Pro, обеспечивает высокую точность, но создает неприемлемые затраты. Исследователь Бенджамин Грейцель (Benjamin Grayzel) поставил задачу: можно ли заменить дорогие модели дешевыми открытыми аналогами, сохранив надежность оценки.

Эксперимент на IMO-GradingBench

Для проверки гипотезы был использован валидационный набор данных из 200 примеров бенчмарка IMO-GradingBench. В эксперименте участвовали три «бюджетные» модели, которым предоставлялись кандидаты на доказательство, эталонное решение и рубрика оценки. Результаты их согласования с человеческими оценками сравнивались с эталонными моделями.

Категория Модель / Метод Ключевая метрика
Frontier-судьи Claude Opus 4.7, Gemini 3.1 Pro Базовый уровень точности
Бюджетные судьи GPT-OSS 120B, DeepSeek-V4 Flash, Gemma-4 31B Согласие с человеком на уровне frontier
Стоимость Бюджетные модели До $100 imes$ дешевле frontier

Стратегия консенсуса: правило «All-Three-Pass»

Изначально предполагалось, что большинство голосов (majority vote) среди трех дешевых моделей даст лучший результат. Однако на полном наборе из 1000 примеров исследователи обнаружили, что правило unanimous agreement (все три модели должны одобрить доказательство) дает наилучшие показатели. Этот подход обеспечивает максимальное совпадение с человеческой оценкой (pass-agreement) и высокую точность (precision), а также минимальную дисперсию результатов между запусками.

Выводы для индустрии

Главный вывод исследования: дешевые модели способны конкурировать с лидерами рынка в задачах оценки доказательств, снижая затраты на один-два порядка. Авторы рекомендуют использовать стратегию «all-three-pass» в качестве стандартного решения для развертывания, хотя и отмечают, что это правило было выявлено постфактум и требует независимой репликации.

Источник: arXiv cs.CL ↗