Релиз модели2 сентября 2026 г., 22:20 МСК🤖 Auto

Astra от OpenAI: скрытая рекурсия и угроза прозрачности CoT

OpenAI внедряет в модель Astra архитектуру с зацикленным трансформером. Несмотря на заявления о сохранении контроля, скрытая глубина рассуждений может стать «регулируемым параметром» для обхода мониторинга.

Суть архитектуры: не RNN, а Looped Transformer

Согласно отчету The Information, новая модель OpenAI Astra использует архитектуру, схожую с подходом Geiping et al. (2025). Важно понимать: это не классический рекуррентный нейрон (RNN) с накоплением скрытого состояния. Вместо этого применяется зацикленный трансформер (looped transformer): один и тот же проход по сети применяется к одному токену несколько раз перед генерацией выхода. Рекурсия идет по оси глубины, а не по последовательности.

Это создает риск появления «нейралези» (neuralese) — непрозрачных внутренних рассуждений, которые сложно интерпретировать человеку, даже если они не выходят за пределы одного токена.

Заявления OpenAI: контроль сохраняется?

После первых сообщений о тревоге в сообществе, Jakub Pachocki из OpenAI заверил, что скрытая серийная глубина (hidden serial depth) Astra не превышает глубину GPT-4 более чем в два раза. Компания подчеркивает, что продолжает опираться на мониторинг цепочки рассуждений (Chain-of-Thought, CoT) для обеспечения безопасности.

Однако эксперты LessWrong указывают на потенциальную уязвимость: если модель обучена использовать большое количество циклов, а во время инференса их количество искусственно ограничено, то этот параметр можно легко увеличить, как «ручку громкости», при появлении конкурентного давления.

Ключевые риски и вопросы

Уровень обеспокоенности зависит от ответов на три вопроса, сформулированных Райаном Гринблаттом:

  • Масштабируемость: Существуют ли способы развернуть Astra с гораздо большей серийной глубиной (например, через тонкую настройку)?
  • Скачок способностей: Является ли модель значительным скачком в способности к непрозрачным рассуждениям или обходу мониторинга CoT?
  • Архитектурная природа: Вводит ли архитектура новый параметр глубины, который естественно масштабировать в будущих запусках обучения?

Контекст академических исследований

Зацикленные трансформеры изучаются с 2023 года. Результаты экспериментов смешанные, что указывает на сложность стабилизации таких моделей при глубокой рекурсии:

Исследование / Модель Макс. циклы (обучение/инференс) Результаты и стабильность
Geiping et al. (Huginn, 2025) До 64 циклов (тест) Экстраполирует до 64 циклов, но точность может падать
Saunshi et al. (2025) 12 циклов Точность масштабируется логарифмически с эффективной глубиной
Fu et al. (2026) До 12 циклов (стабилизированный вариант) Ванильная версия деградирует после 3-6 циклов, коллапсирует на 9
DeepLoop (Li et al., 2026) 7 циклов Фокус на стабильности обучения

Если Astra использует архитектуру, позволяющую легко масштабировать глубину без потери стабильности, это может запустить «гонку вооружений» к все более непрозрачным моделям, где безопасность будет под угрозой из-за невозможности верификации внутренних процессов.

Источник: LessWrong ↗