Суть проблемы: «Ключ» в начале промпта дает несправедливое преимущество
Недавние тесты показали, что модель Astra (предположительно, «зацикленный трансформер» / looped transformer) превосходит Fable 5.1 в задачах на рассуждение без цепочки мыслей (no-CoT) в 8,6 раза. Однако исследователи Agastya Sridharan и Niranjan Deshpande обнаружили, что этот результат может быть артефактом дизайна бенчмарка no-cot-bench.
Проблема заключается в расположении «ключа» (initial state) — начального значения, над которым выполняются операции. В большинстве задач ключ дается в самом начале промпта. Это позволяет модели начать вычисления промежуточных состояний еще во время чтения инструкции, используя механизм внимания для переноса «скрытого состояния» между токенами. Таким образом, бенчмарк измеряет не только глубину последовательного рассуждения, но и способность распределять вычисления по токенам, что является разным навыком.
Методология: Создание Key-Last Benchmark
Чтобы изолировать истинную способность к рассуждению, авторы разработали контрольную группу, где ключ помещается в конец промпта. Это лишает модель возможности начать вычисления заранее. Для исключения эффекта «непонятности» (OOD) формата, авторы добавили нерелевантные вопросы в конец обоих вариантов промптов, показав, что сложность формата не влияет на результат.
Были протестированы 13 вариантов задач (8 из оригинального бенчмарка + 5 новых синтетических доменов) на модели GPT-6.1 Sol. Использовалось 748–1 200 пар тестов на задачу с глубиной от 6 до 18 шагов.
Ключевые метрики и результаты
Перемещение ключа в конец промпта привело к значительному падению производительности. Ниже приведены сравнительные данные по влиянию позиции ключа на глубину рассуждений (точка, при которой точность падает до 50%):
| Метрика | Key-First (Ключ в начале) | Key-Last (Ключ в конце) | Разница / Эффект |
|---|---|---|---|
| Среднее снижение глубины рассуждений | База (100%) | ~84% от базы | Снижение на 16% (медиана по 12 задачам) |
| Диапазон снижения | — | — | От 9% до 45% в зависимости от задачи |
| Точность на нерелевантном вопросе (контроль) | 60.7% | 59.7% | Разница -1.0% (статистически незначимо) |
| Характер падения точности | — | — | Эффект масштаба: каждый дополнительный шаг стоит дороже |
Почему это важно для индустрии AI
Результаты указывают на то, что текущие бенчмарки могут переоценивать способность моделей к «непрозрачному рассуждению» (opaque reasoning). Если модель полагается на распределение вычислений по токенам (эффект Key-First), она может показывать высокие результаты, не обладая истинной способностью удерживать и обрабатывать сложные последовательные состояния в конце контекста.
Исследователи отмечают, что эффект «масштаба» (scale) — то есть стоимость каждого дополнительного шага рассуждения растет быстрее при расположении ключа в конце — вероятно, будет усиливаться по мере увеличения глубины зависимостей. Это требует пересмотра подходов к оценке архитектур, таких как looped transformers, которые часто демонстрируют аномально высокие результаты в no-CoT задачах.
Источник: LessWrong ↗
