Исследования11 сентября 2026 г., 21:17 МСК🤖 Auto

Astra без CoT: глубина спекуляций, а не длина цепи

Исследование Astra выявило, что модель решает сложные задачи без цепочки рассуждений (CoT) не за счет пошагового вывода, а через «спекулятивную глубину» — угадывание промежуточных состояний с последующей параллельной проверкой.

Баннер новости 7297

Провал классических метрик и новый феномен

Традиционные бенчмарки, измеряющие способность LLM выполнять длинные последовательные шаги без использования Chain-of-Thought (CoT), оказались неинформативными. Тестирование модели Astra показало, что количество шагов (step count) слабо коррелирует с успехом. Вместо этого ключевую роль играет спекулятивная глубина (speculative depth) — способность модели угадывать промежуточные результаты на основе эвристик и итеративно уточнять их параллельно, достигая самосогласованности.

Это означает, что Astra не «рассуждает» шаг за шагом в латентном пространстве, а использует форму спекулятивного вывода, что позволяет решать многошаговые задачи с меньшим числом сериализованных операций, чем это кажется возможным.

Исключение «подсказок» в математических задачах

Изначально в бенчмарке LatentMathBench наблюдались аномально высокие результаты Astra (до 500 шагов), но анализ выявил, что модель использовала «короткие пути» (shortcuts). Например, в задачах с одним переменным и операциями целочисленного деления многие входы маппились на один выход, скрывая ошибки. В задачах только с сложением/вычитанием модель применяла стратегии древовидного сведения (tree reduction), известные из предобучения (например, подсчет итогов в чеках).

Для устранения этих артефаков были созданы новые типы задач:

  • swap-N: замена вычислений на простые перестановки значений.
  • bitwise-N: смешение сложения, вычитания и побитового XOR для предотвращения древовидного сведения.

Даже на этих «чистых» задачах Astra опережала конкурентов примерно в 3 раза.

Эксперимент с булевыми цепями: эффект переменных

Чтобы исключить накопление ошибок (как в аналоговых вычислениях), был создан бенчмарк на булевых цепях bool-N. Задачи имели свойства обратимости и прямой зависимости каждого шага от предыдущего. Удивительно, но производительность Astra резко возрастала с увеличением количества переменных, в то время как другие модели оставались стабильными.

Авторы объясняют это двумя факторами:

  1. Короткое замыкание (short-circuiting): Операции and/or позволяют пропускать вычисления, если результат уже предопределен. Больше переменных — больше возможностей для такого пропуска.
  2. Статистическое смещение: Операции or чаще дают True (75%), а and — False (25%), что позволяет модели статистически предсказывать исходы.

Ключевые метрики и сравнение

Результаты тестирования на булевых цепях (bool-N) демонстрируют разрыв между Astra и другими LLM. Метрика «50% success horizon» показывает максимальное количество шагов, при котором вероятность успеха составляет не менее 50%.

Модель bool-26 (XOR only) bool-26 (AND/OR/XOR) Примечание
Astra 11 шагов 54 шага (108 операций) Резкий спад при переходе на чистый XOR, но лидер в комбинированных задачах
Другие LLM Значительно ниже Значительно ниже Менее чувствительны к количеству переменных

Переход с комбинированных операций (AND/OR/XOR) на чистый XOR (bool-26) снизил порог успеха Astra с 54 до 11 шагов, что подтверждает гипотезу о важности нелинейных операций и возможности их «короткого замыкания» для эффективного спекулятивного вывода.

Источник: LessWrong ↗