Исследования11 июля 2026 г., 04:16 МСК🤖 Auto

Hallucination Self-Play: как LLM учатся обнаруживать галлюцинации сами

Исследователи представили HSP — фреймворк, где генератор и детектор галлюцинаций соревнуются в цикле, позволяя малым моделям превзойти большие без внешнего контроля.

Баннер новости 3350

Проблема: нехватка данных для обучения детекторов

Обнаружение фактических галлюцинаций в ответах больших языковых моделей (LLM) остается сложной задачей из-за острого дефицита качественных размеченных данных. Существующие подходы часто используют мощные LLM для синтеза обучающих выборок (создание обоснований, меток и ложных утверждений), но рассматривают генератор как статичный компонент. Это ограничивает возможность итеративного улучшения самого детектора.

Решение: Hallucination Self-Play (HSP)

Авторы предлагают новый фреймворк HSP, который позволяет детектору «bootstrap» (саморазвиваться) за счет эволюции генератора. В основе лежат две роли, инициализированные из одной базовой модели:

  • Генератор: производит все более сложные для обнаружения галлюцинированные ответы.
  • Детектор: оценивает достоверность (faithfulness) выходов модели.

Механика обучения: цикл обратной связи

Процесс оптимизации строится на двух этапах, создающих замкнутый цикл:

  1. Обучение детектора: Сначала детектор дообучается на данных, размеченных людьми (human-labeled data).
  2. RLAIF для генератора: Обученный детектор используется как модель вознаграждения (reward model) для обучения генератора через Reinforcement Learning from AI Feedback (RLAIF). Генератор учится обманывать детектор.
  3. Rule-based RL для детектора: Эволюционировавший генератор синтезирует новые данные с галлюцинациями, которые используются для дальнейшей оптимизации детектора через правил-ориентированное обучение с подкреплением.

Результаты: малые модели против больших

Эксперименты проводились на бенчмарке RAGTruth и двух семействах моделей. Ключевой вывод: предложенный фреймворк позволяет прогрессивно улучшать малую LLM, позволяя ей соответствовать или даже превосходить продвинутые LLM в задачах обнаружения галлюцинаций, при этом не требуя внешнего надзора (external supervision).

Компонент Роль в HSP Метод оптимизации
Детектор Оценка достоверности ответов Дообучение на данных людей → Rule-based RL
Генератор Создание сложных галлюцинаций RLAIF (с использованием детектора как reward model)
Базовая модель Инициализация обоих компонентов Общая архитектура

Код фреймворка доступен в открытом доступе. Работа принята к публикации на конференции COLM 2026.

Источник: arXiv cs.CL ↗