Исследования11 августа 2026 г., 13:17 МСК🤖 Auto

MCF-CVA: Многоуровневая слияние для этики LLM

Исследователи представили MCF-CVA — фреймворк, использующий многоуровневое комбинаторное слияние для преодоления ограничений RLHF и учета этического плюрализма в больших языковых моделях.

Баннер новости 5516

Выравнивание больших языковых моделей (LLM) с человеческими ценностями остается одной из самых сложных задач в области доверенного ИИ. Существующие подходы, такие как RLHF (Reinforcement Learning from Human Feedback) и CAI, часто опираются на архитектуру с одним агентом и единую систему вознаграждений. Это ограничивает их способность улавливать этический плюрализм и адаптироваться к разнообразным моральным контекстам. В статье, опубликованной 7 августа 2026 года, предлагается решение этой проблемы через фреймворк MCF-CVA (Multilayer Combinatorial Fusion for Contextual Value Alignment).

Механика EAR и когнитивное разнообразие

Ключевым нововведением является алгоритм EAR (Expansion and Reduction). Система инициализирует несколько «моральных агентов», каждый из которых дообучен для представления уникальной ценности. Их выходы комбинируются комбинаторно (по баллам и рангам), а затем агрегируются. Этот процесс расширения и последующего сужения до исходного числа агентов повторяется через несколько слоев. Такой подход использует когнитивное разнообразие между агентами для смягчения конфликтов и устранения дублирования, что позволяет генерировать ответы, точнее отражающие контекстные человеческие ценности.

Дуальная архитектура: Евклидово пространство и ранги Кемени

Методология MCF-CVA базируется на дуальной архитектуре, которая обрабатывает данные в двух параллельных пространствах:

  • Пространство оценок Евклида (Euclidean score space): для работы с непрерывными метриками качества.
  • Пространство рангов Кемени (Kemeny rank space): для агрегации порядковых предпочтений, что критично для этических дилемм, где важен не только балл, но и порядок альтернатив.

Результаты сравнения

Эмпирические оценки показали, что предложенный фреймворк превосходит как одноагентные базовые модели, так и многоагентные решения с одним слоем. Ниже приведена сравнительная характеристика подходов:

Метрика / Аспект RLHF / CAI (Базовые) Многоагентные (1 слой) MCF-CVA (Предлагаемый)
Архитектура Один агент, единое вознаграждение Несколько агентов, плоская агрегация Многоуровневое слияние (EAR)
Этический плюрализм Низкий (усреднение мнений) Средний Высокий (контекстуальная адаптация)
Обработка конфликтов Часто игнорируется Частично Активное смягчение через слои
Пространство решений Одномерное Одномерное Дуальное (Евклид + Кемени)

Исследование демонстрирует, что MCF-CVA предоставляет надежный механизм для продвижения контекстуального выравнивания ценностей, предлагая альтернативу упрощенным моделям обучения с подкреплением.

Источник: arXiv cs.AI ↗