Проблема: MoE игнорировались в исследованиях галлюцинаций
Существующие методы борьбы с галлюцинациями (LLM hallucinations) часто не меняют внутреннее знание модели или плохо обобщаются на новые домены. Предыдущие работы по контрастному декодированию (contrastive decoding) фокусировались исключительно на стандартных трансформерах (например, GPT), игнорируя архитектуру Mixture-of-Experts (MoE). Поскольку MoE кардинально меняет структуру обработки данных, исследователи из команды Xinyue Fang и коллег решили проверить, существуют ли в MoE те же самые слоистые различия, которые позволяют корректировать ответы в классических моделях.
Ключевое открытие: Различия есть, но не там, где думали
Эмпирическое исследование показало, что в MoE с общими экспертами (shared experts) слоистых различий нет. Однако, при сравнении разных MoE-моделей между собой, было обнаружено, что на высоких слоях (higher layers) паттерны активации экспертов существенно различаются для фактических и нефактических (галлюцинирующих) выходов. Это открытие стало фундаментом для нового метода.
Решение: Метод EAACD (Expert-Aware Adaptive Contrast Decoding)
Авторы предложили алгоритм EAACD, который использует эти различия для калибровки предсказаний. Механизм работает следующим образом:
- Сегментация экспертов: Эксперты высоких слоев разделяются на группу «высокой надежности» (high-reliability) и несколько групп «низкой надежности» на основе их уверенности и согласованности.
- Контраст: Предсказания надежной группы сравниваются с предсказаниями ненадежных групп для коррекции итогового ответа модели.
- Усиление негативных сигналов: Для усиления эффекта галлюцинации от ненадежных экспертов искусственно усиливаются через механизмы внимания (attention) и маскирования, создавая более сильные «негативные ссылки» для модели.
Результаты: Превосходство над базовыми методами
Метод EAACD был протестирован на задачах问答 (QA) и показал лучшие результаты по сравнению со всеми базовыми моделями (baselines) на четырех различных наборах данных. Это подтверждает, что учет специфики активации экспертов в MoE-архитектурах — эффективный путь к повышению фактологической точности больших языковых моделей.
| Аспект исследования | Найденные данные / Метод | Значение |
|---|---|---|
| Архитектура | Mixture-of-Experts (MoE) | Альтернатива Dense Transformer, требующая новых подходов к контролю |
| Локация различий | Высокие слои (High layers) | Контраст работает только при сравнении разных MoE, а не слоев внутри одной |
| Метод | EAACD | Адаптивное контраст decoding с разделением экспертов на группы надежности |
| Результат | Лучшие показатели на 4 датасетах | Доказана эффективность метода против галлюцинаций в QA-задачах |
Работа принята к публикации в ACL2 (Association for Computational Linguistics), что подчеркивает важность темы для научного сообщества.
Источник: arXiv cs.CL ↗
