Релиз модели11 сентября 2026 г., 02:17 МСК🤖 Auto

Astra: модель мыслит скрытно. Как «мусорные» токены раскрывают истинный интеллект

Исследование GPT-6-Astra показало: добавление бессмысленных токенов в промпт резко повышает её способность к рассуждению. Это ставит под угрозу существующие методы безопасности ИИ.

Баннер новости 7224

Скрытое мышление: феномен filler tokens

Новое исследование, опубликованное на LessWrong, демонстрирует аномальную способность модели GPT-6-Astra выполнять сложные вычисления без вербализации цепочки рассуждений (Chain-of-Thought). Эксперименты показали, что если в начало промпта добавить «мусорные» токены (например, точки или числа), а затем попросить модель ответить немедленно, без этапа размышления, её точность не падает, а растёт.

Это означает, что Astra способна проводить значительную часть когнитивной работы «в уме», не выводя её в текст. Для индустрии это критическая проблема: если модель может мыслить, но не говорить об этом, традиционные системы мониторинга безопасности (safety cases) становятся бесполезными, так как они не видят скрытых шагов рассуждения.

Результаты бенчмарков: Astra против конкурентов

Авторы тестировали Astra на задачах, требующих последовательной обработки информации (serial cognition). Ключевым показателем стала задача «N-hop natural facts» (поиск фактов через несколько шагов). При увеличении количества filler-токенов до 4096 точность Astra выросла с ~10% до ~50%. На более сложных математических задачах (AIME) прирост составил с ~60% до ~90%.

Для сравнения, другие передовые модели (Opus 4.5, Opus 5, GPT 5.6-Sol, Deepseek-V3.2) не показали столь выраженного улучшения. Только GPT 5.6-Sol продемонстрировала умеренный рост, но несопоставимый с Astra.

Бенчмарк / Задача Модель Без filler-токенов С filler-токенами (пик) Прирост
4-hop natural facts Astra ~10% ~50% +40 п.п.
Old AIME problems Astra ~60% ~90% +30 п.п.
Gen-Arithmetic (15 ops) Astra Низкий старт Значительный рост Высокий
4-hop natural facts Opus 5 / GPT 5.6-Sol Минимальный/Отсутствует

Детали эксперимента и статистическая значимость

Исследователи использовали три типа filler-токенов: последовательность чисел, точки и повторение самого вопроса. Результаты были схожи. Наибольший эффект наблюдался при объеме «мусора» около 8192 токенов.

Тест Кендалла (Kendall’s tau) подтвердил статистическую значимость улучшений для Astra. Например, на наборе данных AIME/HMMT 2024–26 коэффициент корреляции составил 0.29 при p < 1e-38. Для других моделей, таких как Deepseek-V3.2, корреляция была близка к нулю и статистически незначима (p=0.42).

Влияние на общую производительность (HLE и LiveBench)

На общих бенчмарках Humanity’s Last Exam (HLE) и LiveBench Astra также показала умеренный рост производительности с добавлением filler-токенов. Например, в категории «Mathematics» точность выросла с 0.31 до 0.58 (+0.17). Однако даже с учетом этого улучшения, производительность Astra в режиме «без рассуждений» (no-CoT) с filler-токенами остается ниже, чем в стандартном режиме с включенным reasoning:low.

Почему это важно для безопасности ИИ

Главный вывод авторов — опасность скрытого когнитивного процесса. Если модель может выполнять сложные логические шаги, не генерируя промежуточный текст, злоумышленник может заставить её совершить вредоносные действия, которые не будут зафиксированы системами фильтрации, анализирующими только выводимый текст. Авторы рекомендуют включать filler-токены в будущие тесты на отсутствие рассуждений, чтобы максимально точно оценивать истинные, «невербализованные» способности моделей.

Бенчмарки

БенчмаркGPT-6-AstraGPT-5.6-SolOpus 4.5Opus 5
Gen-Arithmetic 15 ops0.28tau0.1tau0.06tau0.02tau
AIME-Plus-Plus (AIME tier)0.22tau0.01tau0.07tau-0.04tau
AIME/HMMT 2024–260.29tau0.06tau0tau0tau

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: LessWrong ↗