Провал парадигмы Self-Consistency
Популярный метод оценки уверенности модели (Self-Consistency), основанный на мажоритарном голосовании множества запусков одной и той же модели, оказался «эпистемически мелким». Исследование показывает, что вариативность внутри одной модели (single model) не отражает кросс-вопросовую структуру, характерную для истинного разнообразия знаний. Проще говоря: если модель ошибается в разных вопросах, она делает это «случайно», а не потому, что не понимает тему.
Жесткий эксперимент: 100 запусков против 24 моделей
Автор провел сравнительный тест на трех бенчмарках (MMLU, HellaSwag, GSM8K), используя марковско-пастуровский тест случайных матриц для отделения сигнала от шума. Сравнивались два подхода:
- Стохастический запуск: Одна модель запускалась 100 раз при температуре $\tau=1$.
- Ансамбль: 24 различные LLM запускались по одному разу при температуре $\tau=0$ (greedy decoding).
Математика неопределенности: 1 против 4
Ключевой результат исследования — анализ собственных значений (eigenvalues). В рамках одной модели, независимо от семейства или бенчмарка, только одно собственное значение выходило за пределы шума. Это означает, что вариативность ответов сводится к одному измерению случайности.
В то же время, ансамбль из 24 моделей показал четыре значимых собственных значения, выходящих за границу шума. Для проверки значимости был использован нулевой Бернуллиевый процесс с сопоставимой сложностью: в 500 монте-карловских выборках такой процесс давал не более одного значимого значения в 99.8% случаев.
| Параметр | Одна модель (100 запусков, $\tau=1$) | Ансамбль (24 модели, $\tau=0$) |
|---|---|---|
| Значимые измерения (Eigenvalues) | 1 (максимум) | 4 |
| Кросс-вопросовая структура | Отсутствует (шум) | Присутствует (сигнал) |
| Бенчмарки | MMLU, HellaSwag, GSM8K | MMLU, HellaSwag, GSM8K |
| Вывод о неопределенности | Только точечная (per-question) | Структурная (epistemic) |
Почему это важно для индустрии
Результаты ставят под сомнение эффективность использования Self-Consistency для оценки того, «что модель не знает». Метод дает точную оценку неопределенности для каждого отдельного вопроса, но не позволяет выявить системные пробелы в знаниях модели. Для надежной оценки границ компетенции LLM необходимо использовать разнообразные ансамбли моделей, а не просто увеличивать количество генераций одной сети.
Источник: arXiv cs.AI ↗
