Проблема «ограниченной глубины»
В последние дни обсуждение рекуррентных трансформеров (особенно модели OpenAI Astra) фокусировалось на количестве проходов на токен. Стандартный аргумент безопасности гласил: если число проходов мало, модель выполняет лишь ограниченное количество «непрозрачных» вычислений перед тем, как выдать читаемый токен цепочки рассуждений (Chain-of-Thought, CoT). Однако новый анализ от MBaert опровергает это, указывая на то, что политика разделения KV-кэша может создавать кросс-токенные пути от более глубоких слоев к более ранним.
Механизм обхода: Modulo KV-Sharing
Согласно исследованию Huginn, при схеме bounded-cache (ограниченный кэш) на шаге рекурренции r модель читает и записывает в слот r mod K. Это создает ситуацию, когда:
- Максимальная рекурренция составляет 10 шагов.
- Бюджет кэша — 5 слотов.
- На 6-м шаге рекурренции перезаписывается слот, ассоциированный с 1-м шагом.
Если токен i на раннем этапе обращается к состоянию K/V токена j, который был обновлен на поздней рекурренции, возникает причинно-следственный путь, длина которого растет вместе с длиной последовательности. Фактически, рассуждение происходит в общем KV-кэше, а токены CoT могут быть просто «заглушкой» (filler).
Эксперимент LatentMathBench
Автор провел тест LatentMathBench, генерируя задачи, требующие длинных цепочек многошаговых вычислений (например, последовательные операции с переменными a, b, c, d). Ключевое условие: модель должна была выдать только финальный результат, без вывода промежуточных шагов (zero reasoning tokens). Результаты показали аномальные способности Astra:
| Модель | Особенность | Результат / Наблюдение |
|---|---|---|
| GPT-6 Astra | Рекуррентная архитектура | Горизонт успешности в 4 раза выше, чем у GPT-5.6 Sol, и в 7 раз выше, чем у GPT-4. Выполняла вычисления без вывода CoT. |
| GPT-5.6 Sol | Стандартная архитектура | Значительно уступает Astra в задачах на скрытую глубину вычислений. |
| GPT-4 | Стандартная архитектура | Базовый уровень производительности в данном специфическом тесте. |
| Fable 5/5.1 | Anthropic | Запросы были заблокированы (возможное ограничение на реверс-инжиниринг). |
Почему это важно для безопасности AI
Этот факт напрямую подрывает аргумент из работы Chain of Thought Monitorability, утверждавшей, что CoT — единственный способ передачи информации от более глубоких слоев к более ранним. В моделях с рекуррентным кэшем это не так. Ограничение числа проходов на токен не ограничивает непрозрачную последовательную глубину по всей траектории генерации.
Заявления OpenAI о том, что «глубина графа вычислений» Astra находится в пределах фактора двух от GPT-4, теперь выглядят двусмысленными. Если Astra использует такое разделение кэша, она обладает неограниченной непрозрачной глубиной, что делает мониторинг её истинных рассуждений через CoT практически невозможным. Производительность в LatentMathBench доказывает, что «глубина графа» (как её определяет OpenAI) не является надежным прокси для способности к последовательным рассуждениям без CoT.
Источник: LessWrong ↗
