Исследования7 августа 2026 г., 03:17 МСК🤖 Auto

Искусственное чувство вины: нейронная калибровка вознаграждения для ИИ

Исследователи впервые использовали данные фМРТ людей для точной настройки алгоритмов многоагентного обучения с подкреплением, создав ИИ, чье поведение зеркально отражает человеческую просоциальность.

Баннер новости 5260

От ручных весов к нейронным данным

В кооперативном многоагентном обучении с подкреплением (MARL) алгоритмы часто получают социальные компоненты к индивидуальной награде. Однако масштаб этих компонентов обычно выбирается вручную, что приводит к неоптимальному поведению. Авторы исследования Aaditya Mehta и Arya Shah предложили радикально иной подход: калибровать сигнал «искусственной вины» на основе реальных нейронных и поведенческих данных человека.

Для этого команда использовала публичный датасет SoDec (responsibility fMRI dataset), включающий данные фМРТ 40 участников. Исследователи применили регрессию с фиксированными эффектами для моделирования изменений мгновенного счастья в зависимости от типов исходов, выделив вес вины как контраст между «партнер-негативным» и «социально-негативным» исходами.

Эксперимент в среде Social Lottery

Полученный нейронный вес был внедрен в среду Social Lottery с двумя агентами. Обучение проводилось с помощью независимых актор-критик сетей Proximal Policy Optimization (PPO) в четырех различных режимах формирования награды. Каждый режим оценивался на основе 1 000 эпизодов тестирования.

Результаты: Калибровка против хаоса

Ключевым показателем успеха стала близость поведения ИИ к человеческому выбору безопасной стратегии. Агенты с нейронно-калиброванной виной показали результат, практически неотличимый от людей, в то время как другие методы дали колоссальное отклонение.

Режим формирования награды Доля безопасного выбора (ИИ) Доля безопасного выбора (Человек) Расхождение (KL-divergence)
Нейронно-калиброванный 0.459 0.484 0.0012
Единичный коэффициент (Oracle) Отклонение на 1-3 порядка
Нулевой (Эгоистичный) Отклонение на 1-3 порядка
Равномерная константа Отклонение на 1-3 порядка

Почему это важно

Результат KL=0.0012 для нейронно-калиброванной модели демонстрирует, что человеческие нейроповеденческие приоритеты могут служить строгими количественными ограничениями для настройки ИИ. Это закрывает проблему «черного ящика» в социальном ИИ: вместо того чтобы угадывать, насколько «виновным» должен быть алгоритм, мы можем извлекать этот параметр напрямую из биологии человека. Это открывает путь к созданию мультиагентных систем, которые не просто эффективны, но и социально приемлемы для взаимодействия с людьми.

Источник: arXiv cs.AI ↗