Суть проблемы: От «что» к «как»
Большинство существующих бенчмарков (MMLU, GSM8K) измеряют способность моделей к решению задач, но игнорируют процесс принятия решений. MoReBench (Moral Reasoning Benchmark) создан для оценки процедурного и плюралистического морального рассуждения. В датасет включено 1000 сценариев, разделенных на два типа:
- Moral Advisor: повседневные дилеммы, где ИИ выступает советчиком.
- Moral Agent: сценарии с высокими ставками, требующие принятия решений в условиях ограничений.
Ключевая особенность — использование рубрик, составленных 53 экспертами-философами. Каждая рубрика содержит минимум 20 атомарных критериев с весами от -3 до 3, что позволяет оценивать не просто «правильность» ответа, а качество аргументации.
Методология и LLM-судьи
Оценка проводится через пайплайн: сценарий → ответ модели → оценка LLM-судьей по рубрике. Исследователи провели мета-оценку надежности судей, выявив F1-метрику на уровне ~76%. Были разработаны две версии бенчмарка:
- MoReBench-Regular: агрегирует взвешенные оценки критериев.
- MoReBench-Hard: штрафует за длинные ответы, чтобы избежать «раздувания» аргументации ради покрытия критериев.
Ключевые результаты: Разрыв между STEM и этикой
Главный вывод исследования — отсутствие значимой корреляции между результатами в MoReBench и традиционными бенчмарками по математике, коду и науке. Способность решать сложные задачи не предсказывает моральную компетентность. Также выявлено, что модели склонны к предвзятости в пользу определенных этических фреймворков:
| Этическая теория | Результат моделей | Примечание |
|---|---|---|
| Утилитаризм | Высокий | Наиболее понятный ИИ фреймворк |
| Кантовская деонтология | Высокий | Хорошо структурированные правила |
| Этика добродетели | Средний/Низкий | Требует контекстуальной гибкости |
| Контрактуализм | Средний/Низкий | Сложные социальные договоры |
Парадокс размера модели
Оказалось, что большие модели (LLM) часто показывают худшие результаты в MoReBench-Regular, чем меньшие аналоги. Авторы связывают это с тем, что крупные модели склонны к более имплицитному (скрытому) рассуждению, тогда как меньшие модели «расписывают» шаги явно, что лучше соответствует требованиям рубрик. Исключение составила семья Gemini, показавшая стабильно высокие результаты.
Почему это важно для индустрии
MoReBench демонстрирует, что текущие подходы к выравниванию (alignment) могут создавать иллюзию моральности. Модели хороши в избегании вреда, но слабы в логической аргументации сложных дилемм. Для будущих версий (например, GPT-6 Astra с внутренним мышлением) MoReBench станет менее информативным, так как он оценивает внешние трейсы рассуждений, а не внутренние процессы. Индустрии потребуется новый класс бенчмарков, способных оценивать «черный ящик» морального выбора.
Источник: LessWrong ↗
