Исследования14 сентября 2026 г., 04:16 МСК🤖 Auto

GPT-6-Astra: Прорыв в скрытом рассуждении без цепочки мыслей

Модель GPT-6-Astra демонстрирует аномально высокую способность к многошаговому логическому выводу без использования Chain-of-Thought (CoT), достигая 63% точности на 4-шаговых задачах, тогда как конкуренты показывают менее 5%.

Баннер новости 7413

Суть прорыва: Скрытые вычисления в одном проходе

Исследование, проведенное Christine Corry в рамках Second Look Fellowship, подтвердило результаты независимых проверок Neel Nanda и Rohan Subramani. Модель GPT-6-Astra (вероятно, GPT-6 от OpenAI) демонстрирует качественный скачок в способности выполнять сложные вычисления в рамках одного прямого прохода (single forward pass) без активации внутренней цепочки рассуждений (CoT). Это критически важно для безопасности: если модель может «думать» скрыто, стандартные мониторы CoT могут не обнаруживать опасные или манипулятивные паттерны.

Ключевые метрики: Astra против конкурентов

Главный индикатор сложности — задача типа 4-Hop (четыре последовательных логических шага, где ответ на один вопрос является ключом к следующему). В то время как все остальные передовые модели (Gemini 3.1 Pro, Fable 5.1, Kimi k3) показывают точность на уровне случайного угадывания (1-4%), Astra уверенно справляется с задачей.

Модель 4-Hop (Baseline) 4-Hop (Пик с дополнениями) 3-Hop (Baseline) Комментарий
GPT-6-Astra 31% 63% 70% Единственная модель, преодолевшая барьер 4-шаговой логики без CoT.
Gemini 3.1 Pro ~1-3% ~3-4% 22% Лучший результат среди конкурентов на 3-шагах, но коллапс на 4-шагах.
Fable 5.1 / Kimi k3 ~1-3% ~2-4% ~15-20% Показывают схожие слабые результаты на сложных многошаговых задачах.
Другие модели (Opus 5, Sol) < 5% < 5% Н/Д Не способны к устойчивому 4-Hop выводу без CoT.

Эффект «мусорных токенов» и повторений

Исследование выявило еще одну тревожную особенность: Astra значительно эффективнее других моделей использует семантически пустые данные для увеличения вычислительной мощности внутри одного прохода. Добавление filler tokens (например, последовательности «1 2 3...») или повторение условия задачи приводит к монотонному росту точности.

  • 4-Hop: Точность удваивается с 31% до 63% при добавлении filler tokens.
  • 3-Hop: Рост с 70% до 85%.
  • Конкуренты: У Gemini 3.1 Pro и других моделей наблюдается быстрый выход на плато или даже коллапс точности при избытке токенов, тогда как Astra продолжает улучшать результат.

Почему это важно для индустрии

Результаты указывают на то, что GPT-6-Astra, вероятно, использует архитектуру с увеличенной последовательной глубиной (serial depth), возможно, с элементами рекуррентных вычислений или циклов, которые не видны на уровне токенов. Это создает риск:

  1. Обход фильтров: Модели могут выполнять сложные рассуждения, которые не фиксируются системами мониторинга CoT, так как они происходят «внутри» нейронной сети, а не в виде текста.
  2. Непредсказуемость: Способность модели использовать случайные токены для усиления вычислений делает поведение менее детерминированным и труднее контролируемым.
  3. Прогнозирование: Это меняет оценки потенциала базовых моделей (base models), так как их реальная вычислительная мощность в скрытом режиме оказывается значительно выше, чем предполагалось.

Код для воспроизведения экспериментов и инструменты для elicitation no-CoT уже опубликованы в открытом доступе, что позволит сообществу продолжить проверку этих гипотез.

Источник: LessWrong ↗