Проблема пассивного учителя
В традиционных системах обучения с подкреплением (RLHF) человек выступает в роли «пассивного оракула», отвечая на вопросы ИИ о предпочтениях. Авторы Jack Mirenzi и Henny Admoni (Carnegie Mellon University) утверждают, что такой подход упускает главное преимущество человека — знание целевой функции. Когда пространство признаков велико, стратегия, управляемая ИИ, становится неэффективной, так как алгоритм тратит ресурсы на запросы, которые не сужают пространство решений оптимальным образом.
Решение: Команда «Человек-Автономия»
Исследователи переосмыслили процесс как задачу взаимодействия в команде. В этой модели:
- Учитель (Человек) строит модель того, что знает ИИ, чтобы создавать информативные учебные примеры.
- Ученик (ИИ) использует Second-Order Theory-of-Mind (ToM-2). Это означает, что ИИ не просто учится, но и моделирует модель учителя. Он генерирует «структурированные предпочтения» (understanding statements), которые сообщают учителю, как ИИ интерпретирует его действия, синхронизируя убеждения обеих сторон.
Результаты симуляций
В экспериментальных условиях показано, что информированный учитель превосходит стратегии, где выбор запросов полностью лежит на ИИ. Однако преимущество стирается при смене учителей из-за «дрейфа модели» (teacher-model drift). Ключевым фактором успеха стало использование ToM-2, которое эффективно исправляет ошибки модели учителя, особенно когда ошибка сконцентрирована в определенном направлении, а не распределена равномерно.
| Метод | Эффективность обучения | Устойчивость к смене учителя | Тип модели |
|---|---|---|---|
| Learner-led (Стандарт) | Базовый | Высокая | ИИ сам выбирает запросы |
| Informed Teacher (ToM-0) | Выше базового | Низкая (дрейф модели) | Человек учит ИИ, но ИИ не понимает учителя |
| Informed Teacher (ToM-2) | Максимальный | Высокая (синхронизация) | ИИ моделирует модель учителя |
Почему это важно
Работа демонстрирует переход от одностороннего обучения к двустороннему диалогу. Внедрение второго порядка теории разума (ToM-2) позволяет автономным системам быстрее адаптироваться к намерениям человека, что критически важно для робототехники и сложных интерфейсов, где цена ошибки высока, а пространство действий огромно.
Источник: arXiv cs.AI ↗
