Исследования19 августа 2026 г., 12:18 МСК🤖 Auto

LLM-судья проиграл: Энергетический скоринг лучше ранжирует научные гипотезы

Исследование показало, что оценка гипотез через внутреннюю уверенность модели (logit-based energy scoring) в 3.2 раза эффективнее стандартного промптинга LLM-as-Judge.

Баннер новости 6062

Проблема доверия к AI в науке

Большие языковые модели (LLM) всё активнее используются для генерации научных гипотез. Однако ключевая проблема — объективная оценка этих гипотез. Существующие подходы, такие как использование LLM в роли судьи (LLM-as-Judge) или оценка семантического сходства, часто оказываются предвзятыми: они склонны отдавать предпочтение знакомым идеям, игнорируя инновационные, но нестандартные решения.

Методология: Внутренняя уверенность против сравнения

Авторы работы (Swati Rajwal, Sanjay Das, Tirthankar Ghosal) предложили альтернативный подход — logit-based energy scoring. Этот метод оценивает гипотезу, опираясь на внутреннюю уверенность модели (intrinsic confidence), а не на сравнительное суждение. Эксперимент проводился на выборке из 1 323 научных статей по 12 дисциплинам. Для каждой статьи генерировалась одна правильная гипотеза и 15 ложных альтернатив.

Результаты: Разрыв в эффективности

Было протестировано семь различных языковых моделей. Результаты показали, что метод внутренней уверенности значительно превосходит традиционный подход с промптами для списочного ранжирования (listwise ranking). Ниже приведено сравнение ключевых метрик:

Метод оценки Hit@1 (общий) Hit@1 (лучшая конфигурация) Примечание
LLM-as-Judge (Prompted) 16.6% Стандартный подход сравнения
Logit-Based Energy Scoring 33.0% 53.1% Модель на 1 млрд параметров (post hoc selection)

Общий показатель Hit@1 для метода энергетического скоринга составил 33.0%, что в два раза выше, чем у промптов. При этом сильнейшая конфигурация — модель с 1 миллиардом параметров — достигла показателя 53.1% (максимум среди 14 комбинаций «модель-скорер»).

Значение для индустрии

Результаты исследования ставят под сомнение доминирование LLM-as-Judge в задачах научного поиска. Использование intrinsic confidence позволяет выявлять более качественные и, возможно, более новаторские гипотезы, не будучи ограниченным предвзятостью модели к «популярным» ответам. Авторы призывают сообщество сосредоточиться на разработке методов, основанных на уверенности модели, для создания более надежных систем AI-открытий.

Источник: arXiv cs.AI ↗