Проблема: Иллюзия надежности через голосование
Стандартные стратегии декодирования, такие как Self-Consistency (SC), оценивают качество ответа LLM по принципу большинства: если несколько попыток дают один результат, он считается верным. Однако новый фреймворк GRAPHEVAL доказывает, что этот подход игнорирует логическую валидность промежуточных шагов. Модель может прийти к правильному ответу через ошибочные рассуждения (так называемые «счастливые угадывания»), что создает ложное чувство уверенности.
Решение: Графовая когерентность (GRCS)
Авторы (Riccardo Revalor, Jalees Rehman, Debjit Pal) предлагают переосмыслить оценку неопределенности (UQ) через призму целостности рассуждений. Введен новый метрика — Graph Reasoning Coherence Score (GRCS). Она измеряет семантическое и структурное согласие в пространстве рассуждений, выявляя патологический коллапс режимов и уверенные галлюцинации. GRCS стал единственным показателем, который стабильно отрицательно коррелирует с надежностью рассуждений как в крупных, так и в малых моделях.
Методология: Graph Self-Consistency (GSC)
Вместо простого голосования предлагается стратегия Graph Self-Consistency (GSC), основанная на медианном выборе (medoid-based). Этот метод жертвует номинальной точностью ради логической достоверности. Исследование показало, что выбранный GSC путь является «несущей конструкцией» (load-bearing path): принудительное отклонение от него снижает не только точность, но и надежность рассуждений.
Ключевые результаты
Сравнение традиционных метрик и предложенного подхода демонстрирует существенные различия в оценке качества моделей:
| Метрика / Стратегия | Что оценивает | Выявляет «уверенные галлюцинации»? | Корреляция с надежностью |
|---|---|---|---|
| Self-Consistency (SC) | Согласие финальных ответов | Нет | Слабая / Отсутствует |
| Graph Self-Consistency (GSC) | Структурная целостность пути | Да | Высокая (отрицательная с ошибками) |
| GRCS (метрика) | Семантно-структурное согласие | Да | Стабильно отрицательная |
Исследование опубликовано 9 июля 2026 года в arXiv (cs.CL). Работа содержит 42 страницы, 14 рисунков и 12 таблиц, предлагая новый стандарт для аудита логической состоятельности нейросетей.
Источник: arXiv cs.CL ↗
