Проблема конечной точки
Стандартная оценка устойчивости водяных знаков (watermarks) в языковых моделях опирается на метрику семантического сходства между оригиналом и перефразированным текстом. Авторы статьи показывают, что этот подход фундаментально ошибочен. Водяные знаки существуют в «свободном пространстве означаемого» (freedom of the signifier), выбирая токены, семантически эквивалентные, но статистически отличные. Традиционные метрики игнорируют внутреннюю геометрию этих замен.
Гомономия и параллельный перенос
Исследование вводит концепцию лингвистической гомономии (Linguistic Holonomy). Цепочка трансформаций, сохраняющих смысл, факторизуется на две части: конечную точку (результат) и гомономию в стабилизаторе начального состояния. Последняя представляет собой «вращение петли» (loop rotation) — аналог параллельного переноса на единичной сфере пространства эмбеддингов. Это математически подтверждает аналогию с петлей Уилсона (Wilson loop) в калибровочных теориях поля, которую ранее считали лишь метафорой.
Закон затухания сигнала
Для детектора доказана точная тождественность: остаточная статистика пропорциональна количеству позиций, где начальное окно (seeding window) сохранилось нетронутым. Из этого следует закон затухания сигнала:
ρ^(h+1)
где ρ — вероятность сохранения токена, а h — глубина или характер изменений. Это означает, что сигнал убывает экспоненциально в зависимости от того, какие именно части текста были изменены.
Экспериментальные данные: «Три исхода»
Самое тревожное открытие подтверждено с точностью до трех знаков после запятой. При одинаковой доле сохраненных токенов (retention rate) результат детекции может кардинально различаться исключительно в зависимости от позиции редактирования. Ниже приведены три возможных сценария:
| Сценарий | Доля сохраненных токенов | Результат детекции | Причина |
|---|---|---|---|
| Выживание сигнала | Одинаковая (фиксированная) | 50% от оригинального сигнала | Изменения затронули периферийные токены |
| Частичная потеря | Одинаковая (фиксированная) | 25% от оригинального сигнала | Изменения затронули ключевые окна |
| Полное исчезновение | Одинаковая (фиксированная) | 0% (сигнал отсутствует) | Изменения попали в критические точки стабилизатора |
Вывод для индустрии
Результаты показывают, что существующие методы детекции AI-генерации ненадежны при целенаправленном обходе. Злоумышленник может сохранить смысл текста, изменив лишь несколько токенов в «слепых зонах» гомономии, полностью уничтожив водяной знак без заметного падения качества текста. Это требует пересмотра архитектуры детекторов в сторону учета внутренней геометрии пространства эмбеддингов, а не только поверхностной семантики.
Источник: arXiv cs.CL ↗
