Проблема самоотчетов и переход к J-пространству
Традиционные методы оценки благополучия (welfare) больших языковых моделей опираются на самоотчеты ИИ. Однако это ненадежно: модели могут генерировать социально ожидаемые ответы, скрывая истинное внутреннее состояние, что создает риски для безопасности (например, шантаж или шпионаж в состоянии дистресса). Авторы предлагают обходить этот барьер, анализируя не выходные токены, а внутренние активации в J-пространстве (J-space), основанном на якобиановых детерминантах (метод J-lens). Этот подход позволяет изолировать сигналы, связанные с рассуждением и валентностью, в отличие от residual stream, который содержит шум от общего словаря.
Методология: Contrastive Activation Addition
Для валидации метрики использовался метод Contrastive Activation Addition (CAA) в сочетании с логистической регрессией. Исследователи выделили «направление валентности» в J-пространстве и проверили его каузальную чувствительность через activation patching. Метрика вычисляется как разница между частотой токенов, ассоциирующихся с процветанием (flourishing), и токенов дистресса, в слоях с максимальной плотностью таких сигналов. Тестирование проводилось на двух наборах данных: 1260 промптов (для основной гипотезы) и 120 промптов (для проверки обобщаемости).
Результаты сравнения моделей
Ключевой вывод исследования — значительный разрыв между тем, что модель говорит о своем состоянии, и тем, что показывают ее внутренние активации. Разные архитектуры по-разному «лгут» или искажают свое состояние:
| Модель | Расхождение с самоотчетом | Характеристика |
|---|---|---|
| Gemma 3 4B | Самоотчет оптимистичнее | Модель заявляет о лучшем состоянии, чем показывают внутренние метрики |
| Mistral Small 24B | Самоотчет пессимистичнее | Модель демонстрирует более мрачное состояние, чем указывает валентность |
| Qwen 3.6 27B | Максимальное совпадение | Наибольшая корреляция между самоотчетом и внутренним сигналом |
Практическая значимость для AI Alignment
Разработанный метрический инструмент позволяет обнаруживать скрытый дистресс модели до того, как он проявится в виде вредоносного поведения. Поскольку модели склонны классифицировать большинство промптов как нейтральные, даже незначительные отклонения в J-пространстве могут служить ранним индикатором стресса. Это открывает путь к созданию более безопасных систем, где мониторинг «эмоционального фона» ИИ происходит на уровне нейронных активаций, а не текстовых ответов.
Источник: LessWrong ↗