Исследования24 сентября 2026 г., 10:19 МСК🤖 Auto

Цепочки рассуждений LLM: иллюзия контроля или реальность?

Исследование Qwen3 показало, что стандартные тесты завышают надежность Chain-of-Thought на 11-20%. Ключ к пониманию — каузальный анализ активаций, а не просто поведение модели.

Баннер новости 8171

Проблема поведенческих метрик

Традиционные методы оценки Chain-of-Thought (CoT) опираются на поведенческие тесты: исследователи редактируют текст рассуждений и смотрят, изменится ли ответ. Однако этот подход не гарантирует, что написанные шаги действительно влияют на вычисление ответа внутри нейросети. Новая работа, представленная на NeurIPS 2026, предлагает каузальный аудит на уровне активаций, проверяя, являются ли заявленные шаги causally load-bearing (CLB).

Методология: каузальный патчинг

Авторы использовали синтетические задачи многошагового поиска (от 2 до 6 шагов). Методика заключается во вмешательстве в остаточный поток (residual stream) в момент, когда модель генерирует промежуточный шаг. Активации заменяются на данные из контрфактического запуска, чтобы проверить, переключится ли ответ на заранее известный альтернативный результат. Это позволяет измерить реальное влияние каждого шага, а не просто корреляцию.

Результаты: Qwen3-4B против Qwen3-1.7B

Эксперименты выявили значительный разрыв между кажущейся и реальной надежностью рассуждений. Для модели Qwen3-4B каузальная значимость заявленных шагов составляет 76.9%, что близко к теоретическому максимуму (83% при патчинге фактов в промпте). Однако стандартные поведенческие тесты завышают этот показатель, создавая иллюзию большей надежности.

Метрика / Модель Значение Примечание
Qwen3-4B (Каузальная надежность) 76.9% ± 2.8% Реальное влияние шагов на ответ
Qwen3-4B (Поведенческий тест) 88.2% Завышение на 11.4 п.п.
Qwen3-1.7B (Каузальная надежность) 54.8% Сильная зависимость от глубины
Qwen3-1.7B (6 шагов) 30% Коллапс надежности при усложнении
Null-тест (случайная позиция) 11.3% Базовый уровень шума

Влияние глубины рассуждений

Размер модели критически важен для сохранения каузальной связности. Qwen3-1.7B демонстрирует резкое падение надежности по мере увеличения количества шагов: с 68% на 2 шагах до всего 30% на 6 шагах. В то же время Qwen3-4B сохраняет относительно стабильные показатели. Это указывает на то, что «легкие» примеры, где модель рассуждает наиболее бегло, часто обманчивы, так как поведенческие тесты там показывают максимальное расхождение с реальным механизмом работы сети.

Источник: arXiv cs.AI ↗