Исследования11 июля 2026 г., 05:16 МСК🤖 Auto

GRAPHEVAL: Графовый фреймворк для проверки логики LLM

Исследователи представили GRAPHEVAL — метод оценки надежности рассуждений LLM, который выявляет «уверенные галлюцинации», невидимые для стандартного Self-Consistency.

Баннер новости 3354

Проблема: Иллюзия надежности через голосование

Стандартные стратегии декодирования, такие как Self-Consistency (SC), оценивают качество ответа LLM по принципу большинства: если несколько попыток дают один результат, он считается верным. Однако новый фреймворк GRAPHEVAL доказывает, что этот подход игнорирует логическую валидность промежуточных шагов. Модель может прийти к правильному ответу через ошибочные рассуждения (так называемые «счастливые угадывания»), что создает ложное чувство уверенности.

Решение: Графовая когерентность (GRCS)

Авторы (Riccardo Revalor, Jalees Rehman, Debjit Pal) предлагают переосмыслить оценку неопределенности (UQ) через призму целостности рассуждений. Введен новый метрика — Graph Reasoning Coherence Score (GRCS). Она измеряет семантическое и структурное согласие в пространстве рассуждений, выявляя патологический коллапс режимов и уверенные галлюцинации. GRCS стал единственным показателем, который стабильно отрицательно коррелирует с надежностью рассуждений как в крупных, так и в малых моделях.

Методология: Graph Self-Consistency (GSC)

Вместо простого голосования предлагается стратегия Graph Self-Consistency (GSC), основанная на медианном выборе (medoid-based). Этот метод жертвует номинальной точностью ради логической достоверности. Исследование показало, что выбранный GSC путь является «несущей конструкцией» (load-bearing path): принудительное отклонение от него снижает не только точность, но и надежность рассуждений.

Ключевые результаты

Сравнение традиционных метрик и предложенного подхода демонстрирует существенные различия в оценке качества моделей:

Метрика / Стратегия Что оценивает Выявляет «уверенные галлюцинации»? Корреляция с надежностью
Self-Consistency (SC) Согласие финальных ответов Нет Слабая / Отсутствует
Graph Self-Consistency (GSC) Структурная целостность пути Да Высокая (отрицательная с ошибками)
GRCS (метрика) Семантно-структурное согласие Да Стабильно отрицательная

Исследование опубликовано 9 июля 2026 года в arXiv (cs.CL). Работа содержит 42 страницы, 14 рисунков и 12 таблиц, предлагая новый стандарт для аудита логической состоятельности нейросетей.

Источник: arXiv cs.CL ↗