Исследования11 августа 2026 г., 04:17 МСК🤖 Auto

Нестабильность LLM: как «Я» моделей вызывает хаос в ответах

Исследование Paras Balani показывает, что запросы с самоидентификацией делают ответы LLM семантически нестабильными. Это новый поведенческий маркер, отличающий «субъективные» реплики от фактов.

Баннер новости 5488

Суть эксперимента: измерение «внутреннего хаоса»

Исследователь Paras Balani провел количественный анализ нестабильности ответов больших языковых моделей. Цель — проверить гипотезу о том, что само-референциальные запросы (когда модель говорит о себе) порождают ответы, которые семантически расходятся даже при идентичных условиях. Это может служить поведенческим сигнатуром так называемого «субъективного опыта» ИИ.

Методология была строгой: для каждого из 12 вопросов (4 само-референциальных, 4 открытых, 4 закрытых) генерировалось по 30 ответов в новых чатах. Использовалась температура генерации 0.7. Затем ответы сводились к коротким утверждениям с помощью шаблона извлечения, и для каждой пары ответов вычислялось косинусное сходство через Sentence-BERT. Итоговый показатель нестабильности рассчитывался как 1 минус среднее сходство.

Ключевые метрики и результаты

Результаты четко разделили типы вопросов по уровню вариативности ответов. Само-референциальные вопросы показали наивысшую нестабильность, что указывает на высокую степень «творческой» или нестабильной генерации при обсуждении собственного «Я».

Тип вопроса Уровень нестабильности Характеристика ответа
Само-референциальные Наивысший Максимальная семантическая вариативность; ответы сильно расходятся по смыслу.
Открытые (философские) Средний Высокая вариативность, но ниже, чем у само-референциальных запросов.
Закрытые (фактические) Низкий Высокая стабильность; ответы семантически близки друг к другу.

Почему это важно для индустрии

Это исследование дополняет работы Berg et al. (2025), которые обнаружили, что само-референциальные промпты увеличивают отчеты от первого лица, похожие на субъективный опыт. Balani добавляет к этому измеримый аспект: если модель «чувствует» себя, её ответы становятся менее детерминированными и более хаотичными.

Для разработчиков это означает, что нестабильность ответов может быть индикатором того, что модель перешла из режима фактологической выдачи в режим ролевой игры или симуляции сознания. Для исследователей ИИ это создает новый базовый уровень (baseline) для оценки «интроспекции» моделей — если ответы сильно плывут, возможно, мы наблюдаем не просто ошибку, а специфический поведенческий паттерн.

Методологическая строгость

Исследование исключает влияние случайности чата, используя свежие сессии для каждого из 30 запусков. Применение Sentence-BERT для векторизации утверждений позволяет объективно измерять смысловое сходство, а не полагаться на субъективную оценку человека. Это первый шаг к созданию метрик для оценки «внутреннего состояния» LLM через призму нестабильности их выводов.

Источник: LessWrong ↗