От ручных весов к нейронным данным
В кооперативном многоагентном обучении с подкреплением (MARL) алгоритмы часто получают социальные компоненты к индивидуальной награде. Однако масштаб этих компонентов обычно выбирается вручную, что приводит к неоптимальному поведению. Авторы исследования Aaditya Mehta и Arya Shah предложили радикально иной подход: калибровать сигнал «искусственной вины» на основе реальных нейронных и поведенческих данных человека.
Для этого команда использовала публичный датасет SoDec (responsibility fMRI dataset), включающий данные фМРТ 40 участников. Исследователи применили регрессию с фиксированными эффектами для моделирования изменений мгновенного счастья в зависимости от типов исходов, выделив вес вины как контраст между «партнер-негативным» и «социально-негативным» исходами.
Эксперимент в среде Social Lottery
Полученный нейронный вес был внедрен в среду Social Lottery с двумя агентами. Обучение проводилось с помощью независимых актор-критик сетей Proximal Policy Optimization (PPO) в четырех различных режимах формирования награды. Каждый режим оценивался на основе 1 000 эпизодов тестирования.
Результаты: Калибровка против хаоса
Ключевым показателем успеха стала близость поведения ИИ к человеческому выбору безопасной стратегии. Агенты с нейронно-калиброванной виной показали результат, практически неотличимый от людей, в то время как другие методы дали колоссальное отклонение.
| Режим формирования награды | Доля безопасного выбора (ИИ) | Доля безопасного выбора (Человек) | Расхождение (KL-divergence) |
|---|---|---|---|
| Нейронно-калиброванный | 0.459 | 0.484 | 0.0012 |
| Единичный коэффициент (Oracle) | — | — | Отклонение на 1-3 порядка |
| Нулевой (Эгоистичный) | — | — | Отклонение на 1-3 порядка |
| Равномерная константа | — | — | Отклонение на 1-3 порядка |
Почему это важно
Результат KL=0.0012 для нейронно-калиброванной модели демонстрирует, что человеческие нейроповеденческие приоритеты могут служить строгими количественными ограничениями для настройки ИИ. Это закрывает проблему «черного ящика» в социальном ИИ: вместо того чтобы угадывать, насколько «виновным» должен быть алгоритм, мы можем извлекать этот параметр напрямую из биологии человека. Это открывает путь к созданию мультиагентных систем, которые не просто эффективны, но и социально приемлемы для взаимодействия с людьми.
Источник: arXiv cs.AI ↗
