Проблема изолированного анализа токенов
Существующие детекторы галлюцинаций часто оценивают каждый токен независимо, опираясь на один сигнал. Это приводит к критическим ошибкам: когда модель уверенно генерирует ложную информацию, такие детекторы не способны её выявить. Исследование Igor Itkin предлагает принципиально иной подход, рассматривая галлюцинацию не как изолированное событие, а как временной интервал (span), требующий контекстного анализа.
Архитектура и мульти-сигнальная сущность
Предложенный метод использует 33-мерный поток признаков, который объединяет три ключевых источника данных без доступа к внутренним весам генерирующей модели:
- Статистика текста (текстовые метрики).
- Натурально-языковое рассуждение (NLI entailment) для проверки логической связности.
- Удивление языковой модели (surprisal) — мера неочевидности токена.
Над этим потоком данных работает двунаправленная рекуррентная сеть (BiGRU), которая позволяет «доказательству» распространяться от уверенных позиций к соседним, вызывающим сомнения, внутри одного спана.
Результаты бенчмарков
Метод был протестирован на датасете RAGTruth (10 запусков). Результаты демонстрируют статистически значимое превосходство над базовыми логистическими регрессиями:
| Метрика | Значение | Примечание |
|---|---|---|
| AUC (Temporal Multi-Signal Fusion) | 0.840 | Основной результат |
| AUC (Logistic Regression Baseline) | ~0.730 | Прирост +11 пунктов |
| Статистическая значимость | p = 0.002 | Wilcoxon signed-rank test |
| Максимальный потолок (Ceiling) | 0.845 | Достигнут на Mamba и Attention |
Универсальность и работа с закрытыми моделями
Ключевое преимущество подхода — его независимость от архитектуры генератора. Ограничение производительности (bottleneck) находится в наборе признаков, а не в модели: потолок AUC 0.845 достигается как на рекуррентных сетях, так и на современных архитектурах Mamba и Attention. Это позволяет детектору работать с закрытыми моделями (closed-source), так как он анализирует только сгенерированный текст и внешние сигналы.
Робастность к новым моделям
Детектор сохраняет эффективность на текстах, сгенерированных моделями, которые он никогда не видел в процессе обучения. Потеря точности (AUC) при переходе на новые модели составляет менее 4%, что делает метод практически применимым в реальных условиях, где постоянно появляются новые LLM.
Источник: arXiv cs.CL ↗
