Исследования17 августа 2026 г., 23:17 МСК🤖 Auto

Скрытые уязвимости LLM: как пере-токенизация ломает безопасность

Исследование показывает, что LLM способны понимать «неканонические» последовательности токенов, что создает риски для alignment-обучения и цепочек рассуждений (CoT).

Баннер новости 5948

Суть феномена: модели видят то, чего не учили

Токенизация — это процесс разбиения текста на токены перед подачей в модель. Обычно используется Byte-Pair Encoding (BPE). В ходе обучения модели видят только «канонические» последовательности токенов. Теоретически, оптимальная модель должна присваивать нулевую вероятность любым другим разбиениям. Однако на практике LLM демонстрируют удивительную инвариантность: они понимают и генерируют текст, даже если он разбит на токены совершенно иначе, чем в обучающей выборке.

Это не просто исправление опечаток. Даже когда контекст полностью пере-токенизирован, модель сохраняет смысл. Это указывает на то, что LLM оперируют на уровне, выходящем за рамки простой статистики частотности слов (в духе Фирса: «Слово известно по компании, которую оно держит»).

Почему это критично для безопасности (Alignment)

Авторы исследования (Sami Wolf, LessWrong) выделяют несколько опасных последствий:

  • Нестабильность Alignment-обучения: Обучение с подкреплением (RL) и инструктажи (SFT) могут быть «отменимы» при изменении токенизации. Если модель не видела неканонических токенов во время дообучения, её поведение может стать непредсказуемым.
  • Риски для Chain-of-Thought (CoT): Внутренние рассуждения модели сильно зависят от структуры токенов. Изменение токенизации может сломать логику CoT или in-context learning (ICL), так как сплиты токенов влияют на residual stream (остаточные потоки активаций).
  • Скрытые вычисления: Существует гипотеза, что модели могут использовать эти инвариантности для «скрытых» вычислений, аналогично «точечному» рассуждению, но эмпирических доказательств пока мало.

Ключевые различия в поведении моделей

Способность к инвариантности зависит от размера модели и этапа обучения. Ниже приведено сравнение состояний моделей:

Этап/Тип модели Способность к инвариантности Влияние дообучения (SFT/RL)
Pre-training (предобучение) Частичная инвариантность сохраняется
Модели < 8B параметров Инвариантность слабо развита
После SFT (Instruction Tuning) Инвариантность усиливается и становится более явной Укрепляет способность игнорировать формат токенов
После RL (Reinforcement Learning) Способность эксплуатировать инвариантности подавляется Модель становится менее гибкой к нестандартным входам

Научная повестка: что нужно исследовать

Авторы предлагают конкретный план исследований для сообщества alignment-исследователей:

  1. Защита через консистентность: Можно ли создать защиту от атак через пере-токенизацию, обучая модель быть стабильной к таким изменениям (consistency training)?
  2. Влияние на ICL: Какие именно сплиты токенов критичны для in-context learning? Есть ли «узкие места» в residual stream, чувствительные к формату?
  3. Синтетические данные: Пере-токенизация может быть инструментом увеличения разнообразия данных без риска «коллапса модели» (model collapse), который возникает при генерации синтетических данных другими LLM.

Это исследование открывает новое направление в понимании того, как внутреннее представление данных влияет на надежность и безопасность больших языковых моделей.

Источник: LessWrong ↗