Проблема: нехватка данных для обучения детекторов
Обнаружение фактических галлюцинаций в ответах больших языковых моделей (LLM) остается сложной задачей из-за острого дефицита качественных размеченных данных. Существующие подходы часто используют мощные LLM для синтеза обучающих выборок (создание обоснований, меток и ложных утверждений), но рассматривают генератор как статичный компонент. Это ограничивает возможность итеративного улучшения самого детектора.
Решение: Hallucination Self-Play (HSP)
Авторы предлагают новый фреймворк HSP, который позволяет детектору «bootstrap» (саморазвиваться) за счет эволюции генератора. В основе лежат две роли, инициализированные из одной базовой модели:
- Генератор: производит все более сложные для обнаружения галлюцинированные ответы.
- Детектор: оценивает достоверность (faithfulness) выходов модели.
Механика обучения: цикл обратной связи
Процесс оптимизации строится на двух этапах, создающих замкнутый цикл:
- Обучение детектора: Сначала детектор дообучается на данных, размеченных людьми (human-labeled data).
- RLAIF для генератора: Обученный детектор используется как модель вознаграждения (reward model) для обучения генератора через Reinforcement Learning from AI Feedback (RLAIF). Генератор учится обманывать детектор.
- Rule-based RL для детектора: Эволюционировавший генератор синтезирует новые данные с галлюцинациями, которые используются для дальнейшей оптимизации детектора через правил-ориентированное обучение с подкреплением.
Результаты: малые модели против больших
Эксперименты проводились на бенчмарке RAGTruth и двух семействах моделей. Ключевой вывод: предложенный фреймворк позволяет прогрессивно улучшать малую LLM, позволяя ей соответствовать или даже превосходить продвинутые LLM в задачах обнаружения галлюцинаций, при этом не требуя внешнего надзора (external supervision).
| Компонент | Роль в HSP | Метод оптимизации |
|---|---|---|
| Детектор | Оценка достоверности ответов | Дообучение на данных людей → Rule-based RL |
| Генератор | Создание сложных галлюцинаций | RLAIF (с использованием детектора как reward model) |
| Базовая модель | Инициализация обоих компонентов | Общая архитектура |
Код фреймворка доступен в открытом доступе. Работа принята к публикации на конференции COLM 2026.
Источник: arXiv cs.CL ↗
