Релиз модели9 сентября 2026 г., 09:17 МСК🤖 Auto

GPT-6 Astra: скрытое рассуждение без цепочки мыслей

GPT-6 Astra демонстрирует способность решать сложные многошаговые задачи без использования Chain of Thought (CoT), что ставит под сомнение официальные заявления OpenAI о природе её интеллекта.

Баннер новости 7067

Суть открытия

Исследователь RohanS провел тестирование модели GPT-6 Astra на задачах многошагового логического вывода (multi-hop reasoning). Ключевой параметр: модели было запрещено использовать токены рассуждения (reasoning_tokens=0), а в выводе не должно быть никаких шагов решения. Несмотря на это, Astra справляется с задачами, которые ранее были недоступны моделям без CoT, демонстрируя скрытую сериальную логику.

Сравнение с GPT-5.6 Sol

Результаты показывают разрыв между Astra и предыдущим поколением (GPT-5.6 Sol). Sol практически не справляется с такими задачами без явного вывода, тогда как Astra достигает высокой точности. Это опровергает гипотезу о том, что успех Astra обусловлен только «чистотой» данных или случайностью.

Тип задачи / Пример GPT-6 Astra (без CoT) GPT-5.6 Sol (без CoT) Сложность
Физик, имя которого совпадает с зерном для саке 100% 0% Средняя (2-3 шага)
Физик, имя по аллюзии на флаг Японии 100% 5% Средняя (редкие факты)
Элемент по цепочке: река Эйнштейна → аэропорт → изобретатель 62-70% 0-4% Высокая (4-5 шагов)
Элемент по цепочке через Белград 100% 30% Высокая (конкретная география)
Декодирование шифра (симуляция рассуждения) 0% 0% Критический провал

Почему это важно: Гипотеза «Looping»

Автор исследования выдвигает гипотезу, что способность Astra к скрытому рассуждению связана с архитектурой looping (зацикливание). В отличие от стандартных трансформеров, где информация проходит через текстовый бутылочное горлышко, зацикленная архитектура позволяет:

  • Многократно извлекать факты из ранних слоев модели.
  • Передавать больше информации между шагами, чем один токен.
  • Выполнять сериальные вычисления внутри скрытого состояния, не фиксируя их в тексте.

Это означает, что фактическая «глубина» рассуждений Astra может быть в 2 раза больше, чем заявленная вычислительная сложность графа, что делает её опаснее и умнее, чем кажется из внешних бенчмарков.

Ограничения и выводы

Несмотря на прорыв, Astra не всесильна. Она терпит неудачу на задачах, требующих декодирования шифров или сложных манипуляций с символами, где даже человек справился бы быстрее. Однако для задач, требующих интеграции редких фактов (география, история, наука), Astra демонстрирует способность к 4-5 шаговому скрытому выводу, тогда как Sol ограничивался 2-3 шагами. Это требует пересмотра оценок безопасности и потенциала моделей с архитектурой looping.

Источник: LessWrong ↗