Исследования21 сентября 2026 г., 08:23 МСК🤖 Auto

Топология галлюцинаций: новый метод детекции LLM через кривизну графов

Исследователи представили метод обнаружения галлюцинаций в LLM, основанный на анализе топологии информационных потоков в графах внимания. Подход выявляет структурные аномалии, предшествующие генерации ложных ответов.

Баннер новости 7919

Суть метода: от внимания к топологии

Команда исследователей во главе с Амиром Джалифардом (Amir Jalilifard) предложила новый способ диагностики галлюцинаций в больших языковых моделях. Вместо традиционного анализа вероятностей токенов или сравнения множественных ответов, метод фокусируется на форман-риччиевой кривизне (Forman-Ricci curvature) графов внимания. Этот математический аппарат позволяет выявлять структурные узкие места (bottlenecks) в передаче информации между токенами.

Ключевая гипотеза работы: галлюцинации возникают не случайно, а являются следствием нарушенного обмена контекстом. Когда модель не может эффективно разделить информацию между токенами, она начинает генерировать правдоподобный, но фактологически неверный текст.

Три маркера галлюцинации

Анализ показал, что сгенерированные ответы с галлюцинациями consistently (постоянно) характеризуются тремя специфическими паттернами в работе механизмов внимания, особенно в финальном слое трансформера:

  • Избыточная опора на self-attention: модель игнорирует внешние контекстные токены, полагаясь только на внутренние связи.
  • Размытый контекст: неспособность точно извлечь информацию из предыдущих токенов (diffused context retrieval).
  • Информационное сжатие (Information over-squashing):: перегрузка каналов передачи, когда слишком много информации пытается пройти через слишком мало связей, что приводит к потере важных деталей.

Эмпирические результаты

Метод был протестирован на нескольких архитектурах LLM и стандартных бенчмарках для детекции галлюцинаций. Предложенный подход single-pass (одиночный проход) демонстрирует стабильное улучшение показателей по сравнению с существующими baselines, которые часто требуют множественных прогонов или сложного анализа активаций.

Характеристика Описание
Метрика анализа Форман-риччиева кривизна графов внимания
Обнаруживаемые аномалии Узкие места в потоке информации, over-squashing, дисперсия контекста
Ключевой слой Финальный слой трансформера
Преимущество Single-pass подход (не требует множественных ответов для сравнения)

Почему это важно

Данный подход смещает фокус с пост-фактум проверки фактов на проактивный мониторинг внутренней структуры принятия решений моделью. Понимание того, что галлюцинация — это топологический сбой в распределении внимания, открывает путь к созданию более надежных систем валидации в реальном времени, критически важных для медицины, юриспруденции и финансового секторов.

Источник: arXiv cs.AI ↗