Исследования30 июня 2026 г., 12:19 МСК🤖 Auto

VirtueMap: Как Аристотель оценивает этику LLM

Исследователи представили VirtueMap — методологию оценки LLM через призму аристотелевской этики добродетели, выявляющую скрытые паттерны поведения моделей.

Баннер новости 2557

От «правильного ответа» к профилю добродетели

Традиционные бенчмарки часто ищут единственно верный ответ, но в реальной жизни этические дилеммы требуют компромиссов. Авторы исследования, опубликованного в arXiv (27 июня 2026 г.), предлагают фреймворк VirtueMap, который оценивает Large Language Models (LLM) не по факту правильности, а по выраженности пяти ключевых добродетелей: Практическая мудрость (Practical Wisdom), Справедливость (Justice), Искренность (Truthfulness), Мужество (Courage) и Умеренность (Temperance).

Методология исключает смертельные, политические и религиозные темы, фокусируясь на семи общих этических дилеммах. Для каждой дилеммы модели предлагается выбрать лучший ответ из пяти вариантов, что позволяет построить многомерный профиль «нравственности» ИИ.

Жесткий критерий «Истинной истины»

Ключевая инновация VirtueMap — строгий отбор эталонных ответов. Исследователи не полагаются на мнение одного эксперта. Для формирования референсных порядков (ground truth) проводилась оценка более чем 100 респондентами для каждого сценария. В метрику попадал только тот порядок ответов, который подтверждался 95% участников. Это минимизирует субъективность и создает надежную базу для сравнения.

Результаты тестирования 9 семейств моделей

В рамках повторных запусков (repeated-run evaluation) VirtueMap был применен к девяти различным семействам LLM. Исследование показало высокую стабильность результатов: средняя согласованность рангов составила 90,3%. Однако именно в этой стабильности кроются интересные различия. Наибольший разброс в оценках добродетелей наблюдался в категориях Мужество, Умеренность и Справедливость, что указывает на то, что современные модели по-разному трактуют баланс между честностью, безопасностью и социальной ответственностью.

Доступность и интерактивность

Авторы не просто опубликовали теорию, но и выпустили интерактивный веб-сайт, позволяющий вычислять профили добродетели локально в браузере. Это дает возможность не только сравнивать модели между собой, но и сопоставлять этические профили людей с профилями ИИ, открывая новые горизонты для изучения взаимодействия человека и машины.

Категория Описание в контексте VirtueMap Ключевая метрика/Наблюдение
Методология Ранжирование 5 ответов на 7 дилемм Порог согласия людей: ≥95%
Добродетели 5 аристотелевских качеств Мудрость, Справедливость, Искренность, Мужество, Умеренность
Стабильность Повторные запуски (repeated-run) Средняя согласованность рангов: 90.3%
Зоны разногласий Где модели ведут себя по-разному Мужество, Умеренность, Справедливость

Почему это важно

VirtueMap смещает фокус с бинарной оценки «безопасно/опасно» на качественное понимание того, какие именно ценности закладывает разработчик в модель. Это критически важно для настройки alignment (соответствия ценностей) в сложных сценариях, где нет очевидного «правильного» решения, но есть выбор между приоритетами.

Источник: arXiv cs.AI ↗