Суть открытия: Astra обходит необходимость в Chain-of-Thought
Недавние тесты на бенчмарке nocot-bench (No-CoT Reasoning Index) показали, что модель Astra значительно превосходит предыдущие поколения OpenAI (Sol, Luna, Terra) в задачах, требующих логического вывода без использования развернутой цепочки рассуждений (Chain-of-Thought, CoT). Это означает, что модель способна выполнять нетривиальные вычисления «в уме» — за один прямой проход нейросети (single forward pass), не генерируя промежуточные текстовые шаги.
Экономия ресурсов: Astra vs Sol при reasoning_effort=low
Исследование фокусировалось на режиме reasoning_effort=low, который оптимизирован для скорости и минимального потребления токенов. Анализ показал, что Astra использует радикально меньше токенов на рассуждение, чем ее предшественники. В то время как Sol и другие модели часто вербализируют каждый шаг вычислений, Astra генерирует только финальный ответ или минимальную последовательность промежуточных значений.
На примере задачи типа Chain (последовательность арифметических операций с условиями), где базовое решение (просто вывод чисел после каждого шага) занимает около 10 токенов, Astra укладывается в 4–7 токенов сверх базового уровня. Это свидетельствует о том, что модель применяет правила (деления, проверки четности, пороговые значения) внутри скрытых слоев, не вынося их в текст.
Точность и надежность: Таблица результатов
Ключевой вопрос: насколько надежна такая «молчаливая» логика? Данные показывают, что Astra сохраняет высокую точность даже на сложных задачах, где другие модели начинают ошибаться при отсутствии развернутого CoT. Ниже приведено сравнение способности моделей решать задачи типа «Chain» (цепочка вычислений) без использования CoT.
| Модель | Макс. длина цепочки (шагов) с 100% точностью (No-CoT) | Примечание |
|---|---|---|
| Astra | До 6 шагов | Результаты взяты из nocot-bench (Neel Nanda). Модель стабильно решает задачи за один проход. |
| Sol | 1-2 шага | Часто требует развернутого CoT для корректного решения. Лишь в редких случаях (5 из множества) применяет No-CoT. |
| Luna / Terra | 1 шаг | Практически не способны к No-CoT логике в сложных сценариях. |
Почему это важно для индустрии
Способность к No-CoT мышлению имеет два ключевых последствия:
- Эффективность: Модели, способные обходиться без длинных цепочек рассуждений, потребляют меньше вычислительных ресурсов и времени, что критично для приложений реального времени и масштабирования.
- Безопасность и прозрачность: Высокий уровень No-CoT способностей вызывает опасения у исследователей. Если модель принимает сложные решения «черным ящиком» без возможности проанализировать ход мыслей, это усложняет аудит и контроль за потенциально вредным поведением. Однако Astra, судя по всему, не использует свои максимальные No-CoT возможности на пределе, чтобы снизить риск ошибок, которые «умножаются» в длинных цепочках.
Этот анализ демонстрирует, что следующее поколение ИИ-моделей может стать не только умнее, но и «тише» — выполняя сложную работу внутри себя, не требуя от пользователя чтения длинных логических выкладок.
Источник: LessWrong ↗
