Исследования24 июля 2026 г., 08:17 МСК🤖 Auto

Само-согласованность LLM — иллюзия: одномерная стохастика против ансамблей

Исследование Izhar Ali (EIML@ICML 2026) доказывает, что вариативность ответов одной модели при температуре 1 не раскрывает её истинных пробелов в знаниях. Только разнообразные ансамбли из 24 моделей показывают многомерную структуру неопределенности.

Баннер новости 4268

Провал парадигмы Self-Consistency

Популярный метод оценки уверенности модели (Self-Consistency), основанный на мажоритарном голосовании множества запусков одной и той же модели, оказался «эпистемически мелким». Исследование показывает, что вариативность внутри одной модели (single model) не отражает кросс-вопросовую структуру, характерную для истинного разнообразия знаний. Проще говоря: если модель ошибается в разных вопросах, она делает это «случайно», а не потому, что не понимает тему.

Жесткий эксперимент: 100 запусков против 24 моделей

Автор провел сравнительный тест на трех бенчмарках (MMLU, HellaSwag, GSM8K), используя марковско-пастуровский тест случайных матриц для отделения сигнала от шума. Сравнивались два подхода:

  • Стохастический запуск: Одна модель запускалась 100 раз при температуре $\tau=1$.
  • Ансамбль: 24 различные LLM запускались по одному разу при температуре $\tau=0$ (greedy decoding).

Математика неопределенности: 1 против 4

Ключевой результат исследования — анализ собственных значений (eigenvalues). В рамках одной модели, независимо от семейства или бенчмарка, только одно собственное значение выходило за пределы шума. Это означает, что вариативность ответов сводится к одному измерению случайности.

В то же время, ансамбль из 24 моделей показал четыре значимых собственных значения, выходящих за границу шума. Для проверки значимости был использован нулевой Бернуллиевый процесс с сопоставимой сложностью: в 500 монте-карловских выборках такой процесс давал не более одного значимого значения в 99.8% случаев.

Параметр Одна модель (100 запусков, $\tau=1$) Ансамбль (24 модели, $\tau=0$)
Значимые измерения (Eigenvalues) 1 (максимум) 4
Кросс-вопросовая структура Отсутствует (шум) Присутствует (сигнал)
Бенчмарки MMLU, HellaSwag, GSM8K MMLU, HellaSwag, GSM8K
Вывод о неопределенности Только точечная (per-question) Структурная (epistemic)

Почему это важно для индустрии

Результаты ставят под сомнение эффективность использования Self-Consistency для оценки того, «что модель не знает». Метод дает точную оценку неопределенности для каждого отдельного вопроса, но не позволяет выявить системные пробелы в знаниях модели. Для надежной оценки границ компетенции LLM необходимо использовать разнообразные ансамбли моделей, а не просто увеличивать количество генераций одной сети.

Источник: arXiv cs.AI ↗