Проблема «черного ящика» в MoE Reward Models
Современные модели вознаграждения (Reward Models), основанные на архитектуре Sparse Mixture-of-Experts (MoE), часто критикуют за сложность интерпретации. Традиционные методы пытаются объяснить поведение модели, анализируя веса маршрутизации (routing weights). Однако этот подход имеет фундаментальный недостаток: он показывает только то, какие промпты получает эксперт, но не раскрывает, как именно эксперт оценивает ответы. Это создает разрыв между тем, что модель «видит», и тем, как она «суждит».
Решение: Contribution Contrast (CoCo)
Команда исследователей во главе с Yifan Wang предложила метод CoCo (Contribution Contrast). В отличие от старых подходов, CoCo анализирует пары выбранных (chosen) и отклоненных (rejected) ответов, выделяя те, где вклад конкретного эксперта в итоговое решение максимален. Это позволяет:
- Точно определить роль каждого эксперта в принятии решений.
- Объединить анализ маршрутизации и поведения предпочтений.
- Получить интерпретацию на уровне конкретного ответа (response-level), а не просто на уровне входа.
Результаты сравнения
Авторы провели систематическое сравнение CoCo с альтернативными методами, включая router-based, score-based и подходы на основе sparse autoencoders. Оценка проводилась как автоматически, так и с участием людей (human evaluation). CoCo продемонстрировал более высокую согласованность (coherence) и достоверность (faithfulness) интерпретаций.
| Метод интерпретации | Основа анализа | Ключевое ограничение |
|---|---|---|
| Router-based | Веса маршрутизации (routing weights) | Показывает только входящие данные, а не процесс оценки |
| Score-based | Прямые баллы экспертов | Игнорирует контекст выбора между альтернативами |
| Sparse Autoencoders | Визуализация активаций | Сложность сопоставления с конкретными логическими выводами |
| CoCo (предлагаемый) | Контраст вклада в парах chosen/rejected | Требует вычислительных ресурсов для анализа пар |
Значение для индустрии
Это первое систематическое исследование методов интерпретации именно для MoE Reward Models. Улучшение прозрачности таких моделей критически важно для безопасности ИИ и тонкой настройки (RLHF), так как позволяет разработчикам точно понимать, какие аспекты текста или логики «нравятся» или «не нравятся» модели, и корректировать их поведение.
Источник: arXiv cs.AI ↗
