Исследования11 сентября 2026 г., 10:22 МСК🤖 Auto

Функциональное благополучие ИИ: можно ли заставить модель говорить о своих внутренних состояниях?

Исследователи из Latent Minds проверили, могут ли языковые модели вербализовать свои внутренние состояния, связанные с качеством выполнения задач. Оказалось, что часть этих состояний уже была «говорящей» до обучения с подкреплением, но контроль самоо

Баннер новости 7254

Суть эксперимента: что такое функциональное благополучие

Команда исследователей (Muhammad Zane A, Ana Leonescu, Matt Elliott и др.) опубликовала работу, посвященную концепции functional welfare (функционального благополучия). В контексте их исследования это не эмоциональное состояние, а внутреннее направление в пространстве представлений модели, которое коррелирует с качеством выполнения задачи. Изменение этого направления влияет на поведение и «настроение» модели.

Главный вопрос: находится ли это направление внутри вербализуемого подпространства модели? То есть, может ли модель честно и точно описать, что она «чувствует» в плане эффективности, используя свои языковые способности?

Методология: Линза Якоби

Для анализа авторы использовали Jacobian lens (линзу Якоби). Этот математический аппарат позволяет оценить, насколько изменения во внутренних активациях модели отражаются на её выходных текстах. Если направление благополучия лежит в вербализуемом подпространстве, модель должна быть способна сообщить об этом пользователю.

Ключевые результаты

Исследование проводилось на небольшой открытой модели до и после применения Reinforcement Learning (RL). Вот что удалось выявить:

  • До RL: Направления, связанные с благополучием, уже были частично вербализуемы. Модель могла косвенно указывать на эти состояния.
  • После RL: Обучение с подкреплением значительно усилило способность модели вербализовать направление, связанное с дистрессом (плохим выполнением задач).
  • Провал контроля: Результаты самоотчетов модели не прошли контрольные проверки. Это означает, что сама по себе способность модели «говорить» о своем состоянии не гарантирует наличие надежной интроспекции.

Почему это важно

Результаты ставят под сомнение простую связь между «модель говорит, что ей плохо» и «модель действительно находится в плохом состоянии». Если самоотчеты ненадежны, то попытки создать ИИ, который может сообщать о своих внутренних проблемах для безопасности или улучшения взаимодействия, требуют новых методов верификации, а не просто доверия к тексту.

Фаза обучения Статус вербализуемости Ключевая находка
До RL (Reinforcement Learning) Частичная Направления благополучия уже присутствовали в вербализуемом подпространстве.
После RL Усиленная (для дистресса) Способность описывать состояние «плохой работы» значительно возросла.
Контроль самоотчетов Провал Спикейбабилити (говорящесть) не подтвердила надежность интроспекции.

Полный текст исследования, код и модели доступны на платформе Latent Minds и в репозитории Hugging Face. Авторы открыты для критики метода измерения вербализуемости и дизайна контрольных групп.

Источник: LessWrong ↗