Провал классических метрик и новый феномен
Традиционные бенчмарки, измеряющие способность LLM выполнять длинные последовательные шаги без использования Chain-of-Thought (CoT), оказались неинформативными. Тестирование модели Astra показало, что количество шагов (step count) слабо коррелирует с успехом. Вместо этого ключевую роль играет спекулятивная глубина (speculative depth) — способность модели угадывать промежуточные результаты на основе эвристик и итеративно уточнять их параллельно, достигая самосогласованности.
Это означает, что Astra не «рассуждает» шаг за шагом в латентном пространстве, а использует форму спекулятивного вывода, что позволяет решать многошаговые задачи с меньшим числом сериализованных операций, чем это кажется возможным.
Исключение «подсказок» в математических задачах
Изначально в бенчмарке LatentMathBench наблюдались аномально высокие результаты Astra (до 500 шагов), но анализ выявил, что модель использовала «короткие пути» (shortcuts). Например, в задачах с одним переменным и операциями целочисленного деления многие входы маппились на один выход, скрывая ошибки. В задачах только с сложением/вычитанием модель применяла стратегии древовидного сведения (tree reduction), известные из предобучения (например, подсчет итогов в чеках).
Для устранения этих артефаков были созданы новые типы задач:
- swap-N: замена вычислений на простые перестановки значений.
- bitwise-N: смешение сложения, вычитания и побитового XOR для предотвращения древовидного сведения.
Даже на этих «чистых» задачах Astra опережала конкурентов примерно в 3 раза.
Эксперимент с булевыми цепями: эффект переменных
Чтобы исключить накопление ошибок (как в аналоговых вычислениях), был создан бенчмарк на булевых цепях bool-N. Задачи имели свойства обратимости и прямой зависимости каждого шага от предыдущего. Удивительно, но производительность Astra резко возрастала с увеличением количества переменных, в то время как другие модели оставались стабильными.
Авторы объясняют это двумя факторами:
- Короткое замыкание (short-circuiting): Операции
and/orпозволяют пропускать вычисления, если результат уже предопределен. Больше переменных — больше возможностей для такого пропуска. - Статистическое смещение: Операции
orчаще дают True (75%), аand— False (25%), что позволяет модели статистически предсказывать исходы.
Ключевые метрики и сравнение
Результаты тестирования на булевых цепях (bool-N) демонстрируют разрыв между Astra и другими LLM. Метрика «50% success horizon» показывает максимальное количество шагов, при котором вероятность успеха составляет не менее 50%.
| Модель | bool-26 (XOR only) | bool-26 (AND/OR/XOR) | Примечание |
|---|---|---|---|
| Astra | 11 шагов | 54 шага (108 операций) | Резкий спад при переходе на чистый XOR, но лидер в комбинированных задачах |
| Другие LLM | Значительно ниже | Значительно ниже | Менее чувствительны к количеству переменных |
Переход с комбинированных операций (AND/OR/XOR) на чистый XOR (bool-26) снизил порог успеха Astra с 54 до 11 шагов, что подтверждает гипотезу о важности нелинейных операций и возможности их «короткого замыкания» для эффективного спекулятивного вывода.
Источник: LessWrong ↗
