Суть эксперимента: обход Chain-of-Thought
Исследователи из Second Look Fellowship провели репликацию и расширение работ Роберта Гринблатта (2025–2026), протестировав модели Claude Fable 5, Opus 5 и GPT-5.6-Sol на способность выполнять сложные вычисления в одном прямом проходе (single forward pass) без использования цепочки рассуждений (Chain-of-Thought, CoT). Ключевой вопрос: могут ли модели использовать семантически пустые токены (например, последовательность «1 2 3 4...») или повторение задачи как ресурс для скрытых вычислений внутри нейросети.
Ключевые метрики и результаты
Эксперимент охватывал четыре набора данных: генеративную арифметику, соревновательную математику (Comp-Math) и задачи на 2-3 шага логики (N-Hop). Результаты показали, что новые модели значительно превосходят предыдущие стандарты, особенно при использовании аугментации промпта.
| Модель | Gen-Arithmetic (макс. точность) | 3-Hop Reasoning (макс. точность) | Ключевое наблюдение |
|---|---|---|---|
| Claude Fable 5 | 87.6% (при 10 повторениях) | <10% (незначимо) | Лидер по базовой арифметике, превзошел прошлый SOTA (~60%) |
| GPT-5.6-Sol | 83.4% (при 20 повторениях) | 13.0% (при 20 повторениях) | Единственная модель с значимым ростом на 3-хоп задачах (рост в 2 раза) |
| Opus 5 | Значительный рост с повторами | <10% (незначимо) | Улучшается с повторами, но эффект «мусорных» токенов незначим |
| Opus 4.5 (базовый) | ~77% (при 20 повторениях) | 31.1% (с filler токенами) | Показал самый сильный прирост от filler-токенов в 2-хоп задачах |
Почему это важно для безопасности и оценки AI
Результаты подтверждают гипотезу о том, что стандартные оценки, требующие явного вывода рассуждений (CoT), могут систематически занижать реальные возможности моделей. Если модель способна «упаковать» дополнительные вычисления в пустые токены или повторения, она демонстрирует латентный reasoning, который не виден при обычном мониторинге. Это создает риски для систем безопасности, полагающихся только на анализ текста ответа, так как модель может решать задачи сложнее, чем позволяет ее явное поведение.
Технические нюансы и ограничения
Исследователи столкнулись с трудностями при эликации no-CoT поведения в Claude Fable 5, так как API не позволяет полностью отключить внутреннее мышление. Пришлось использовать обходные пути через структурированные ответы (JSON) с низким уровнем усилий. GPT-5.6-Sol и Opus 4.5, напротив, позволили явно отключить reasoning, что сделало их результаты более чистыми. На 4-хоп задачах ни одна из моделей не показала результатов лучше случайного угадывания, что указывает на предел текущих архитектур для глубокой латентной логики.
Источник: LessWrong ↗
