Суть метода: от внимания к топологии
Команда исследователей во главе с Амиром Джалифардом (Amir Jalilifard) предложила новый способ диагностики галлюцинаций в больших языковых моделях. Вместо традиционного анализа вероятностей токенов или сравнения множественных ответов, метод фокусируется на форман-риччиевой кривизне (Forman-Ricci curvature) графов внимания. Этот математический аппарат позволяет выявлять структурные узкие места (bottlenecks) в передаче информации между токенами.
Ключевая гипотеза работы: галлюцинации возникают не случайно, а являются следствием нарушенного обмена контекстом. Когда модель не может эффективно разделить информацию между токенами, она начинает генерировать правдоподобный, но фактологически неверный текст.
Три маркера галлюцинации
Анализ показал, что сгенерированные ответы с галлюцинациями consistently (постоянно) характеризуются тремя специфическими паттернами в работе механизмов внимания, особенно в финальном слое трансформера:
- Избыточная опора на self-attention: модель игнорирует внешние контекстные токены, полагаясь только на внутренние связи.
- Размытый контекст: неспособность точно извлечь информацию из предыдущих токенов (diffused context retrieval).
- Информационное сжатие (Information over-squashing):: перегрузка каналов передачи, когда слишком много информации пытается пройти через слишком мало связей, что приводит к потере важных деталей.
Эмпирические результаты
Метод был протестирован на нескольких архитектурах LLM и стандартных бенчмарках для детекции галлюцинаций. Предложенный подход single-pass (одиночный проход) демонстрирует стабильное улучшение показателей по сравнению с существующими baselines, которые часто требуют множественных прогонов или сложного анализа активаций.
| Характеристика | Описание |
|---|---|
| Метрика анализа | Форман-риччиева кривизна графов внимания |
| Обнаруживаемые аномалии | Узкие места в потоке информации, over-squashing, дисперсия контекста |
| Ключевой слой | Финальный слой трансформера |
| Преимущество | Single-pass подход (не требует множественных ответов для сравнения) |
Почему это важно
Данный подход смещает фокус с пост-фактум проверки фактов на проактивный мониторинг внутренней структуры принятия решений моделью. Понимание того, что галлюцинация — это топологический сбой в распределении внимания, открывает путь к созданию более надежных систем валидации в реальном времени, критически важных для медицины, юриспруденции и финансового секторов.
Источник: arXiv cs.AI ↗
