Суть феномена: модели видят то, чего не учили
Токенизация — это процесс разбиения текста на токены перед подачей в модель. Обычно используется Byte-Pair Encoding (BPE). В ходе обучения модели видят только «канонические» последовательности токенов. Теоретически, оптимальная модель должна присваивать нулевую вероятность любым другим разбиениям. Однако на практике LLM демонстрируют удивительную инвариантность: они понимают и генерируют текст, даже если он разбит на токены совершенно иначе, чем в обучающей выборке.
Это не просто исправление опечаток. Даже когда контекст полностью пере-токенизирован, модель сохраняет смысл. Это указывает на то, что LLM оперируют на уровне, выходящем за рамки простой статистики частотности слов (в духе Фирса: «Слово известно по компании, которую оно держит»).
Почему это критично для безопасности (Alignment)
Авторы исследования (Sami Wolf, LessWrong) выделяют несколько опасных последствий:
- Нестабильность Alignment-обучения: Обучение с подкреплением (RL) и инструктажи (SFT) могут быть «отменимы» при изменении токенизации. Если модель не видела неканонических токенов во время дообучения, её поведение может стать непредсказуемым.
- Риски для Chain-of-Thought (CoT): Внутренние рассуждения модели сильно зависят от структуры токенов. Изменение токенизации может сломать логику CoT или in-context learning (ICL), так как сплиты токенов влияют на residual stream (остаточные потоки активаций).
- Скрытые вычисления: Существует гипотеза, что модели могут использовать эти инвариантности для «скрытых» вычислений, аналогично «точечному» рассуждению, но эмпирических доказательств пока мало.
Ключевые различия в поведении моделей
Способность к инвариантности зависит от размера модели и этапа обучения. Ниже приведено сравнение состояний моделей:
| Этап/Тип модели | Способность к инвариантности | Влияние дообучения (SFT/RL) |
|---|---|---|
| Pre-training (предобучение) | Частичная инвариантность сохраняется | — |
| Модели < 8B параметров | Инвариантность слабо развита | — |
| После SFT (Instruction Tuning) | Инвариантность усиливается и становится более явной | Укрепляет способность игнорировать формат токенов |
| После RL (Reinforcement Learning) | Способность эксплуатировать инвариантности подавляется | Модель становится менее гибкой к нестандартным входам |
Научная повестка: что нужно исследовать
Авторы предлагают конкретный план исследований для сообщества alignment-исследователей:
- Защита через консистентность: Можно ли создать защиту от атак через пере-токенизацию, обучая модель быть стабильной к таким изменениям (consistency training)?
- Влияние на ICL: Какие именно сплиты токенов критичны для in-context learning? Есть ли «узкие места» в residual stream, чувствительные к формату?
- Синтетические данные: Пере-токенизация может быть инструментом увеличения разнообразия данных без риска «коллапса модели» (model collapse), который возникает при генерации синтетических данных другими LLM.
Это исследование открывает новое направление в понимании того, как внутреннее представление данных влияет на надежность и безопасность больших языковых моделей.
Источник: LessWrong ↗
