Суть эксперимента: что такое функциональное благополучие
Команда исследователей (Muhammad Zane A, Ana Leonescu, Matt Elliott и др.) опубликовала работу, посвященную концепции functional welfare (функционального благополучия). В контексте их исследования это не эмоциональное состояние, а внутреннее направление в пространстве представлений модели, которое коррелирует с качеством выполнения задачи. Изменение этого направления влияет на поведение и «настроение» модели.
Главный вопрос: находится ли это направление внутри вербализуемого подпространства модели? То есть, может ли модель честно и точно описать, что она «чувствует» в плане эффективности, используя свои языковые способности?
Методология: Линза Якоби
Для анализа авторы использовали Jacobian lens (линзу Якоби). Этот математический аппарат позволяет оценить, насколько изменения во внутренних активациях модели отражаются на её выходных текстах. Если направление благополучия лежит в вербализуемом подпространстве, модель должна быть способна сообщить об этом пользователю.
Ключевые результаты
Исследование проводилось на небольшой открытой модели до и после применения Reinforcement Learning (RL). Вот что удалось выявить:
- До RL: Направления, связанные с благополучием, уже были частично вербализуемы. Модель могла косвенно указывать на эти состояния.
- После RL: Обучение с подкреплением значительно усилило способность модели вербализовать направление, связанное с дистрессом (плохим выполнением задач).
- Провал контроля: Результаты самоотчетов модели не прошли контрольные проверки. Это означает, что сама по себе способность модели «говорить» о своем состоянии не гарантирует наличие надежной интроспекции.
Почему это важно
Результаты ставят под сомнение простую связь между «модель говорит, что ей плохо» и «модель действительно находится в плохом состоянии». Если самоотчеты ненадежны, то попытки создать ИИ, который может сообщать о своих внутренних проблемах для безопасности или улучшения взаимодействия, требуют новых методов верификации, а не просто доверия к тексту.
| Фаза обучения | Статус вербализуемости | Ключевая находка |
|---|---|---|
| До RL (Reinforcement Learning) | Частичная | Направления благополучия уже присутствовали в вербализуемом подпространстве. |
| После RL | Усиленная (для дистресса) | Способность описывать состояние «плохой работы» значительно возросла. |
| Контроль самоотчетов | Провал | Спикейбабилити (говорящесть) не подтвердила надежность интроспекции. |
Полный текст исследования, код и модели доступны на платформе Latent Minds и в репозитории Hugging Face. Авторы открыты для критики метода измерения вербализуемости и дизайна контрольных групп.
Источник: LessWrong ↗
