Исследования20 августа 2026 г., 11:17 МСК🤖 Auto

Новый метод детекции галлюцинаций LLM: AUC 0.84 без доступа к весам

Игорь Иткин представил метод Temporal Multi-Signal Fusion, повышающий точность обнаружения галлюцинаций на уровне токенов на 11 пунктов за счет анализа временных зависимостей и внешних сигналов.

Баннер новости 6149

Проблема изолированного анализа токенов

Существующие детекторы галлюцинаций часто оценивают каждый токен независимо, опираясь на один сигнал. Это приводит к критическим ошибкам: когда модель уверенно генерирует ложную информацию, такие детекторы не способны её выявить. Исследование Igor Itkin предлагает принципиально иной подход, рассматривая галлюцинацию не как изолированное событие, а как временной интервал (span), требующий контекстного анализа.

Архитектура и мульти-сигнальная сущность

Предложенный метод использует 33-мерный поток признаков, который объединяет три ключевых источника данных без доступа к внутренним весам генерирующей модели:

  • Статистика текста (текстовые метрики).
  • Натурально-языковое рассуждение (NLI entailment) для проверки логической связности.
  • Удивление языковой модели (surprisal) — мера неочевидности токена.

Над этим потоком данных работает двунаправленная рекуррентная сеть (BiGRU), которая позволяет «доказательству» распространяться от уверенных позиций к соседним, вызывающим сомнения, внутри одного спана.

Результаты бенчмарков

Метод был протестирован на датасете RAGTruth (10 запусков). Результаты демонстрируют статистически значимое превосходство над базовыми логистическими регрессиями:

Метрика Значение Примечание
AUC (Temporal Multi-Signal Fusion) 0.840 Основной результат
AUC (Logistic Regression Baseline) ~0.730 Прирост +11 пунктов
Статистическая значимость p = 0.002 Wilcoxon signed-rank test
Максимальный потолок (Ceiling) 0.845 Достигнут на Mamba и Attention

Универсальность и работа с закрытыми моделями

Ключевое преимущество подхода — его независимость от архитектуры генератора. Ограничение производительности (bottleneck) находится в наборе признаков, а не в модели: потолок AUC 0.845 достигается как на рекуррентных сетях, так и на современных архитектурах Mamba и Attention. Это позволяет детектору работать с закрытыми моделями (closed-source), так как он анализирует только сгенерированный текст и внешние сигналы.

Робастность к новым моделям

Детектор сохраняет эффективность на текстах, сгенерированных моделями, которые он никогда не видел в процессе обучения. Потеря точности (AUC) при переходе на новые модели составляет менее 4%, что делает метод практически применимым в реальных условиях, где постоянно появляются новые LLM.

Источник: arXiv cs.CL ↗