Суть архитектуры: не RNN, а Looped Transformer
Согласно отчету The Information, новая модель OpenAI Astra использует архитектуру, схожую с подходом Geiping et al. (2025). Важно понимать: это не классический рекуррентный нейрон (RNN) с накоплением скрытого состояния. Вместо этого применяется зацикленный трансформер (looped transformer): один и тот же проход по сети применяется к одному токену несколько раз перед генерацией выхода. Рекурсия идет по оси глубины, а не по последовательности.
Это создает риск появления «нейралези» (neuralese) — непрозрачных внутренних рассуждений, которые сложно интерпретировать человеку, даже если они не выходят за пределы одного токена.
Заявления OpenAI: контроль сохраняется?
После первых сообщений о тревоге в сообществе, Jakub Pachocki из OpenAI заверил, что скрытая серийная глубина (hidden serial depth) Astra не превышает глубину GPT-4 более чем в два раза. Компания подчеркивает, что продолжает опираться на мониторинг цепочки рассуждений (Chain-of-Thought, CoT) для обеспечения безопасности.
Однако эксперты LessWrong указывают на потенциальную уязвимость: если модель обучена использовать большое количество циклов, а во время инференса их количество искусственно ограничено, то этот параметр можно легко увеличить, как «ручку громкости», при появлении конкурентного давления.
Ключевые риски и вопросы
Уровень обеспокоенности зависит от ответов на три вопроса, сформулированных Райаном Гринблаттом:
- Масштабируемость: Существуют ли способы развернуть Astra с гораздо большей серийной глубиной (например, через тонкую настройку)?
- Скачок способностей: Является ли модель значительным скачком в способности к непрозрачным рассуждениям или обходу мониторинга CoT?
- Архитектурная природа: Вводит ли архитектура новый параметр глубины, который естественно масштабировать в будущих запусках обучения?
Контекст академических исследований
Зацикленные трансформеры изучаются с 2023 года. Результаты экспериментов смешанные, что указывает на сложность стабилизации таких моделей при глубокой рекурсии:
| Исследование / Модель | Макс. циклы (обучение/инференс) | Результаты и стабильность |
|---|---|---|
| Geiping et al. (Huginn, 2025) | До 64 циклов (тест) | Экстраполирует до 64 циклов, но точность может падать |
| Saunshi et al. (2025) | 12 циклов | Точность масштабируется логарифмически с эффективной глубиной |
| Fu et al. (2026) | До 12 циклов (стабилизированный вариант) | Ванильная версия деградирует после 3-6 циклов, коллапсирует на 9 |
| DeepLoop (Li et al., 2026) | 7 циклов | Фокус на стабильности обучения |
Если Astra использует архитектуру, позволяющую легко масштабировать глубину без потери стабильности, это может запустить «гонку вооружений» к все более непрозрачным моделям, где безопасность будет под угрозой из-за невозможности верификации внутренних процессов.
Источник: LessWrong ↗