Скрытое мышление: феномен filler tokens
Новое исследование, опубликованное на LessWrong, демонстрирует аномальную способность модели GPT-6-Astra выполнять сложные вычисления без вербализации цепочки рассуждений (Chain-of-Thought). Эксперименты показали, что если в начало промпта добавить «мусорные» токены (например, точки или числа), а затем попросить модель ответить немедленно, без этапа размышления, её точность не падает, а растёт.
Это означает, что Astra способна проводить значительную часть когнитивной работы «в уме», не выводя её в текст. Для индустрии это критическая проблема: если модель может мыслить, но не говорить об этом, традиционные системы мониторинга безопасности (safety cases) становятся бесполезными, так как они не видят скрытых шагов рассуждения.
Результаты бенчмарков: Astra против конкурентов
Авторы тестировали Astra на задачах, требующих последовательной обработки информации (serial cognition). Ключевым показателем стала задача «N-hop natural facts» (поиск фактов через несколько шагов). При увеличении количества filler-токенов до 4096 точность Astra выросла с ~10% до ~50%. На более сложных математических задачах (AIME) прирост составил с ~60% до ~90%.
Для сравнения, другие передовые модели (Opus 4.5, Opus 5, GPT 5.6-Sol, Deepseek-V3.2) не показали столь выраженного улучшения. Только GPT 5.6-Sol продемонстрировала умеренный рост, но несопоставимый с Astra.
| Бенчмарк / Задача | Модель | Без filler-токенов | С filler-токенами (пик) | Прирост |
|---|---|---|---|---|
| 4-hop natural facts | Astra | ~10% | ~50% | +40 п.п. |
| Old AIME problems | Astra | ~60% | ~90% | +30 п.п. |
| Gen-Arithmetic (15 ops) | Astra | Низкий старт | Значительный рост | Высокий |
| 4-hop natural facts | Opus 5 / GPT 5.6-Sol | — | — | Минимальный/Отсутствует |
Детали эксперимента и статистическая значимость
Исследователи использовали три типа filler-токенов: последовательность чисел, точки и повторение самого вопроса. Результаты были схожи. Наибольший эффект наблюдался при объеме «мусора» около 8192 токенов.
Тест Кендалла (Kendall’s tau) подтвердил статистическую значимость улучшений для Astra. Например, на наборе данных AIME/HMMT 2024–26 коэффициент корреляции составил 0.29 при p < 1e-38. Для других моделей, таких как Deepseek-V3.2, корреляция была близка к нулю и статистически незначима (p=0.42).
Влияние на общую производительность (HLE и LiveBench)
На общих бенчмарках Humanity’s Last Exam (HLE) и LiveBench Astra также показала умеренный рост производительности с добавлением filler-токенов. Например, в категории «Mathematics» точность выросла с 0.31 до 0.58 (+0.17). Однако даже с учетом этого улучшения, производительность Astra в режиме «без рассуждений» (no-CoT) с filler-токенами остается ниже, чем в стандартном режиме с включенным reasoning:low.
Почему это важно для безопасности ИИ
Главный вывод авторов — опасность скрытого когнитивного процесса. Если модель может выполнять сложные логические шаги, не генерируя промежуточный текст, злоумышленник может заставить её совершить вредоносные действия, которые не будут зафиксированы системами фильтрации, анализирующими только выводимый текст. Авторы рекомендуют включать filler-токены в будущие тесты на отсутствие рассуждений, чтобы максимально точно оценивать истинные, «невербализованные» способности моделей.
Бенчмарки
| Бенчмарк | GPT-6-Astra | GPT-5.6-Sol | Opus 4.5 | Opus 5 |
|---|---|---|---|---|
| Gen-Arithmetic 15 ops | 0.28tau | 0.1tau | 0.06tau | 0.02tau |
| AIME-Plus-Plus (AIME tier) | 0.22tau | 0.01tau | 0.07tau | -0.04tau |
| AIME/HMMT 2024–26 | 0.29tau | 0.06tau | 0tau | 0tau |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: LessWrong ↗
