Выравнивание больших языковых моделей (LLM) с человеческими ценностями остается одной из самых сложных задач в области доверенного ИИ. Существующие подходы, такие как RLHF (Reinforcement Learning from Human Feedback) и CAI, часто опираются на архитектуру с одним агентом и единую систему вознаграждений. Это ограничивает их способность улавливать этический плюрализм и адаптироваться к разнообразным моральным контекстам. В статье, опубликованной 7 августа 2026 года, предлагается решение этой проблемы через фреймворк MCF-CVA (Multilayer Combinatorial Fusion for Contextual Value Alignment).
Механика EAR и когнитивное разнообразие
Ключевым нововведением является алгоритм EAR (Expansion and Reduction). Система инициализирует несколько «моральных агентов», каждый из которых дообучен для представления уникальной ценности. Их выходы комбинируются комбинаторно (по баллам и рангам), а затем агрегируются. Этот процесс расширения и последующего сужения до исходного числа агентов повторяется через несколько слоев. Такой подход использует когнитивное разнообразие между агентами для смягчения конфликтов и устранения дублирования, что позволяет генерировать ответы, точнее отражающие контекстные человеческие ценности.
Дуальная архитектура: Евклидово пространство и ранги Кемени
Методология MCF-CVA базируется на дуальной архитектуре, которая обрабатывает данные в двух параллельных пространствах:
- Пространство оценок Евклида (Euclidean score space): для работы с непрерывными метриками качества.
- Пространство рангов Кемени (Kemeny rank space): для агрегации порядковых предпочтений, что критично для этических дилемм, где важен не только балл, но и порядок альтернатив.
Результаты сравнения
Эмпирические оценки показали, что предложенный фреймворк превосходит как одноагентные базовые модели, так и многоагентные решения с одним слоем. Ниже приведена сравнительная характеристика подходов:
| Метрика / Аспект | RLHF / CAI (Базовые) | Многоагентные (1 слой) | MCF-CVA (Предлагаемый) |
|---|---|---|---|
| Архитектура | Один агент, единое вознаграждение | Несколько агентов, плоская агрегация | Многоуровневое слияние (EAR) |
| Этический плюрализм | Низкий (усреднение мнений) | Средний | Высокий (контекстуальная адаптация) |
| Обработка конфликтов | Часто игнорируется | Частично | Активное смягчение через слои |
| Пространство решений | Одномерное | Одномерное | Дуальное (Евклид + Кемени) |
Исследование демонстрирует, что MCF-CVA предоставляет надежный механизм для продвижения контекстуального выравнивания ценностей, предлагая альтернативу упрощенным моделям обучения с подкреплением.
Источник: arXiv cs.AI ↗
