Аномальный скачок в No-CoT рассуждениях
Исследователь Neel Nanda провел независимую валидацию данных UK AISI по модели Astra, используя собственный бенчмарк No CoT Reasoning Index (NCRI). Результаты подтвердили гипотезу о том, что Astra демонстрирует непропорционально высокий уровень рассуждений без использования цепочки мыслей (Chain of Thought).
Ключевая метрика: вероятность того, что Astra решит произвольную задачу без CoT, в 8.6 раза выше, чем у модели Fable 5.1 (второе место). Для сравнения, 10 пунктов роста NCRI соответствуют удвоению вероятности успешного решения задачи.
Серийная глубина: 7.2 шага против 4.1
Самое тревожное открытие касается «серийной глубины» (serial depth) — количества последовательных шагов вычислений, которые модель может выполнить за один прямой проход (forward pass). Чем выше этот показатель, тем сложнее контролировать модель, так как она не полагается на внешние цепочки рассуждений для расширения своих вычислительных пределов.
| Метрика | Astra | Следующий лучший (Gemini 3.8 Flash / Fable 5.1) | Отношение |
|---|---|---|---|
| Серийная глубина (арифметические шаги) | 7.2 | 4.1 | ~1.75x |
| Вероятность решения задачи (NCRI) | Базовый уровень | Базовый уровень | 8.6x (в пользу Astra) |
Архитектурная аномалия: петлевая структура
Анализ показывает, что улучшения Astra не равномерны. Модель демонстрирует «перекос» в сторону задач с высокой параллельной и серийной глубиной (синтетические вычисления, поиск кратчайшего пути, многошаговая арифметика). В то время как другие модели показывают корреляцию между общим интеллектом и No-CoT навыками, Astra выделяется на фоне диаграммы рассеяния, показывая результат на 40 пунктов NCRI выше (что эквивалентно 16-кратному увеличению вероятности успеха) в синтетических задачах по сравнению с нетипичными когнитивными задачами.
Автор исследования связывает эту аномалию с петлевой архитектурой (looping architecture) модели, которая позволяет ей выполнять больше вычислений внутри одного прохода, минуя необходимость в развертывании цепочки мыслей.
Почему это критично для безопасности ИИ
Цепочка мыслей (CoT) традиционно служит основным инструментом мониторинга: она делает процесс рассуждения модели прозрачным и длинным, что позволяет аудиторам отслеживать логику. Однако, если модель способна выполнять сложные вычисления (до 7.2 серийных шагов) без вербализации процесса, она становится «черным ящиком» внутри одного forward pass.
Это означает, что стандартные методы контроля, основанные на анализе текстовых цепочек рассуждений, теряют эффективность. Astra демонстрирует, что новые архитектуры могут обходить эти ограничения, делая модели значительно более сложными для обнаружения скрытых намерений или ошибок до момента их проявления.
Источник: LessWrong ↗
