Исследования22 августа 2026 г., 02:18 МСК🤖 Auto

Лингвистическая гомономия: почему водяные знаки LLM исчезают при перефразировании

Исследование Daniele Corradetti доказывает, что статистические водяные знаки уязвимы не к степени изменений текста, а к их позиции. Эффективность детекции падает до нуля из-за «геометрии» трансформаций.

Баннер новости 6279

Проблема конечной точки

Стандартная оценка устойчивости водяных знаков (watermarks) в языковых моделях опирается на метрику семантического сходства между оригиналом и перефразированным текстом. Авторы статьи показывают, что этот подход фундаментально ошибочен. Водяные знаки существуют в «свободном пространстве означаемого» (freedom of the signifier), выбирая токены, семантически эквивалентные, но статистически отличные. Традиционные метрики игнорируют внутреннюю геометрию этих замен.

Гомономия и параллельный перенос

Исследование вводит концепцию лингвистической гомономии (Linguistic Holonomy). Цепочка трансформаций, сохраняющих смысл, факторизуется на две части: конечную точку (результат) и гомономию в стабилизаторе начального состояния. Последняя представляет собой «вращение петли» (loop rotation) — аналог параллельного переноса на единичной сфере пространства эмбеддингов. Это математически подтверждает аналогию с петлей Уилсона (Wilson loop) в калибровочных теориях поля, которую ранее считали лишь метафорой.

Закон затухания сигнала

Для детектора доказана точная тождественность: остаточная статистика пропорциональна количеству позиций, где начальное окно (seeding window) сохранилось нетронутым. Из этого следует закон затухания сигнала:

ρ^(h+1)

где ρ — вероятность сохранения токена, а h — глубина или характер изменений. Это означает, что сигнал убывает экспоненциально в зависимости от того, какие именно части текста были изменены.

Экспериментальные данные: «Три исхода»

Самое тревожное открытие подтверждено с точностью до трех знаков после запятой. При одинаковой доле сохраненных токенов (retention rate) результат детекции может кардинально различаться исключительно в зависимости от позиции редактирования. Ниже приведены три возможных сценария:

Сценарий Доля сохраненных токенов Результат детекции Причина
Выживание сигнала Одинаковая (фиксированная) 50% от оригинального сигнала Изменения затронули периферийные токены
Частичная потеря Одинаковая (фиксированная) 25% от оригинального сигнала Изменения затронули ключевые окна
Полное исчезновение Одинаковая (фиксированная) 0% (сигнал отсутствует) Изменения попали в критические точки стабилизатора

Вывод для индустрии

Результаты показывают, что существующие методы детекции AI-генерации ненадежны при целенаправленном обходе. Злоумышленник может сохранить смысл текста, изменив лишь несколько токенов в «слепых зонах» гомономии, полностью уничтожив водяной знак без заметного падения качества текста. Это требует пересмотра архитектуры детекторов в сторону учета внутренней геометрии пространства эмбеддингов, а не только поверхностной семантики.

Источник: arXiv cs.CL ↗