Проблема поведенческих метрик
Традиционные методы оценки Chain-of-Thought (CoT) опираются на поведенческие тесты: исследователи редактируют текст рассуждений и смотрят, изменится ли ответ. Однако этот подход не гарантирует, что написанные шаги действительно влияют на вычисление ответа внутри нейросети. Новая работа, представленная на NeurIPS 2026, предлагает каузальный аудит на уровне активаций, проверяя, являются ли заявленные шаги causally load-bearing (CLB).
Методология: каузальный патчинг
Авторы использовали синтетические задачи многошагового поиска (от 2 до 6 шагов). Методика заключается во вмешательстве в остаточный поток (residual stream) в момент, когда модель генерирует промежуточный шаг. Активации заменяются на данные из контрфактического запуска, чтобы проверить, переключится ли ответ на заранее известный альтернативный результат. Это позволяет измерить реальное влияние каждого шага, а не просто корреляцию.
Результаты: Qwen3-4B против Qwen3-1.7B
Эксперименты выявили значительный разрыв между кажущейся и реальной надежностью рассуждений. Для модели Qwen3-4B каузальная значимость заявленных шагов составляет 76.9%, что близко к теоретическому максимуму (83% при патчинге фактов в промпте). Однако стандартные поведенческие тесты завышают этот показатель, создавая иллюзию большей надежности.
| Метрика / Модель | Значение | Примечание |
|---|---|---|
| Qwen3-4B (Каузальная надежность) | 76.9% ± 2.8% | Реальное влияние шагов на ответ |
| Qwen3-4B (Поведенческий тест) | 88.2% | Завышение на 11.4 п.п. |
| Qwen3-1.7B (Каузальная надежность) | 54.8% | Сильная зависимость от глубины |
| Qwen3-1.7B (6 шагов) | 30% | Коллапс надежности при усложнении |
| Null-тест (случайная позиция) | 11.3% | Базовый уровень шума |
Влияние глубины рассуждений
Размер модели критически важен для сохранения каузальной связности. Qwen3-1.7B демонстрирует резкое падение надежности по мере увеличения количества шагов: с 68% на 2 шагах до всего 30% на 6 шагах. В то же время Qwen3-4B сохраняет относительно стабильные показатели. Это указывает на то, что «легкие» примеры, где модель рассуждает наиболее бегло, часто обманчивы, так как поведенческие тесты там показывают максимальное расхождение с реальным механизмом работы сети.
Источник: arXiv cs.AI ↗
