Исследования10 августа 2026 г., 07:19 МСК🤖 Auto

CoCo: Новый метод интерпретации MoE Reward Models

Исследователи представили метод Contribution Contrast (CoCo), который позволяет точно анализировать работу экспертов в смесевых моделях вознаграждения, превосходя традиционные подходы.

Баннер новости 5404

Проблема «черного ящика» в MoE Reward Models

Современные модели вознаграждения (Reward Models), основанные на архитектуре Sparse Mixture-of-Experts (MoE), часто критикуют за сложность интерпретации. Традиционные методы пытаются объяснить поведение модели, анализируя веса маршрутизации (routing weights). Однако этот подход имеет фундаментальный недостаток: он показывает только то, какие промпты получает эксперт, но не раскрывает, как именно эксперт оценивает ответы. Это создает разрыв между тем, что модель «видит», и тем, как она «суждит».

Решение: Contribution Contrast (CoCo)

Команда исследователей во главе с Yifan Wang предложила метод CoCo (Contribution Contrast). В отличие от старых подходов, CoCo анализирует пары выбранных (chosen) и отклоненных (rejected) ответов, выделяя те, где вклад конкретного эксперта в итоговое решение максимален. Это позволяет:

  • Точно определить роль каждого эксперта в принятии решений.
  • Объединить анализ маршрутизации и поведения предпочтений.
  • Получить интерпретацию на уровне конкретного ответа (response-level), а не просто на уровне входа.

Результаты сравнения

Авторы провели систематическое сравнение CoCo с альтернативными методами, включая router-based, score-based и подходы на основе sparse autoencoders. Оценка проводилась как автоматически, так и с участием людей (human evaluation). CoCo продемонстрировал более высокую согласованность (coherence) и достоверность (faithfulness) интерпретаций.

Метод интерпретации Основа анализа Ключевое ограничение
Router-based Веса маршрутизации (routing weights) Показывает только входящие данные, а не процесс оценки
Score-based Прямые баллы экспертов Игнорирует контекст выбора между альтернативами
Sparse Autoencoders Визуализация активаций Сложность сопоставления с конкретными логическими выводами
CoCo (предлагаемый) Контраст вклада в парах chosen/rejected Требует вычислительных ресурсов для анализа пар

Значение для индустрии

Это первое систематическое исследование методов интерпретации именно для MoE Reward Models. Улучшение прозрачности таких моделей критически важно для безопасности ИИ и тонкой настройки (RLHF), так как позволяет разработчикам точно понимать, какие аспекты текста или логики «нравятся» или «не нравятся» модели, и корректировать их поведение.

Источник: arXiv cs.AI ↗