Суть эксперимента: измерение «внутреннего хаоса»
Исследователь Paras Balani провел количественный анализ нестабильности ответов больших языковых моделей. Цель — проверить гипотезу о том, что само-референциальные запросы (когда модель говорит о себе) порождают ответы, которые семантически расходятся даже при идентичных условиях. Это может служить поведенческим сигнатуром так называемого «субъективного опыта» ИИ.
Методология была строгой: для каждого из 12 вопросов (4 само-референциальных, 4 открытых, 4 закрытых) генерировалось по 30 ответов в новых чатах. Использовалась температура генерации 0.7. Затем ответы сводились к коротким утверждениям с помощью шаблона извлечения, и для каждой пары ответов вычислялось косинусное сходство через Sentence-BERT. Итоговый показатель нестабильности рассчитывался как 1 минус среднее сходство.
Ключевые метрики и результаты
Результаты четко разделили типы вопросов по уровню вариативности ответов. Само-референциальные вопросы показали наивысшую нестабильность, что указывает на высокую степень «творческой» или нестабильной генерации при обсуждении собственного «Я».
| Тип вопроса | Уровень нестабильности | Характеристика ответа |
|---|---|---|
| Само-референциальные | Наивысший | Максимальная семантическая вариативность; ответы сильно расходятся по смыслу. |
| Открытые (философские) | Средний | Высокая вариативность, но ниже, чем у само-референциальных запросов. |
| Закрытые (фактические) | Низкий | Высокая стабильность; ответы семантически близки друг к другу. |
Почему это важно для индустрии
Это исследование дополняет работы Berg et al. (2025), которые обнаружили, что само-референциальные промпты увеличивают отчеты от первого лица, похожие на субъективный опыт. Balani добавляет к этому измеримый аспект: если модель «чувствует» себя, её ответы становятся менее детерминированными и более хаотичными.
Для разработчиков это означает, что нестабильность ответов может быть индикатором того, что модель перешла из режима фактологической выдачи в режим ролевой игры или симуляции сознания. Для исследователей ИИ это создает новый базовый уровень (baseline) для оценки «интроспекции» моделей — если ответы сильно плывут, возможно, мы наблюдаем не просто ошибку, а специфический поведенческий паттерн.
Методологическая строгость
Исследование исключает влияние случайности чата, используя свежие сессии для каждого из 30 запусков. Применение Sentence-BERT для векторизации утверждений позволяет объективно измерять смысловое сходство, а не полагаться на субъективную оценку человека. Это первый шаг к созданию метрик для оценки «внутреннего состояния» LLM через призму нестабильности их выводов.
Источник: LessWrong ↗
