Исследования10 июля 2026 г., 13:18 МСК🤖 Auto

Согласие LLM не равно истине: исследование 265 000 ответов

Крупное исследование опровергает миф о том, что консенсус между моделями или самосогласованность гарантируют правильность ответа. На выборке в 265 000 примеров показано, что передовые модели часто ошибаются, будучи уверенными в себе.

Баннер новости 3294

Крах гипотезы LLM-as-judge

В индустрии искусственного интеллекта доминирует предположение, что если несколько моделей (или одна модель в нескольких запусках) выдают одинаковый ответ, он с высокой вероятностью верен. Этот принцип лежит в основе систем оценки LLM-as-judge и ансамблей экспертов. Однако новое исследование Kaihua Ding, опубликованное в arXiv, доказывает, что согласие — это ненадежный индикатор точности. Модели могут сговариваться из-за общих смещений, запомненных эвристик или позиционных приоритетов, а не из-за знания истины.

Масштаб эксперимента: 265 000 сэмплов

Для проверки гипотезы авторы провели масштабное исследование с участием 53 независимых исполнителей (runners). Были протестированы модели разных уровней (tier), различные методы промптинга и масштабы. В качестве бенчмарков использовались сложные наборы данных GPQA Diamond и AIME, требующие глубоких знаний и рассуждений. Всего было обработано 265 000 образцов (по K=50 сэмплов на случай), что позволило использовать статистически значимые методы, такие как иерархическая бутстрап-выборка.

Ключевые метрики и парадокс уверенности

Исследование показало, что корреляция между согласием и правильностью слабая (коэффициент ранговой корреляции Спирмена rho 0.20–0.59). Наиболее тревожный результат выявлен для передовых (frontier) моделей: они демонстрируют высокую самосогласованность, но при этом часто ошибаются. На датасете GPQA Diamond такие модели достигали согласия >=0.8 в 77% случаев, однако в 48% из этих «уверенных» случаев ответ был неверным. Это явление повторяется и при кросс-семейной проверке моделей Claude, указывая на системную проблему, а не сбой конкретного провайдера.

Параметр Значение / Наблюдение Значение для индустрии
Объем выборки 265 000 сэмплов (53 раннера, K=50) Высокая статистическая значимость результатов
Бенчмарки GPQA Diamond, AIME Тестирование на сложных задачах, требующих рассуждений
Корреляция согласия и точности rho 0.20–0.59 Слабая предсказательная сила консенсуса
Уверенность Frontier-моделей Согласие >=0.8 в 77% случаев Модели «уверены» в большинстве ответов
Ошибка при высокой уверенности 48% неверных ответов при согласии >=0.8 Почти половина «уверенных» ответов — галлюцинации

Когда согласие все же работает?

Авторы не отвергают метод полностью, но определяют его нишу. Согласие является полезным прокси-индикатором для модернизационных моделей среднего уровня (mid-tier), которые еще не достигли насыщения в своих знаниях. Также этот метод эффективен для распределения вычислительных ресурсов (compute allocation), помогая решать, когда стоит запускать дополнительные промпты. Однако использовать его как единственный сигнал уверенности для самых мощных современных моделей опасно — они склонны к «уверенным ошибкам» (confident errors).

Открытые данные

Исследователи опубликовали обезличенные данные по каждому запуску и распределения ответов, чтобы сообщество могло верифицировать выводы. Это важный шаг к переходу от слепой веры в консенсус LLM к более строгим методам аудита надежности AI-систем в enterprise-пайплайнах.

Источник: arXiv cs.AI ↗