Исследования3 сентября 2026 г., 06:17 МСК🤖 Auto

Водяные знаки LLM: статистическая проверка гипотез вместо магии

Крупные ИИ-модели внедряют водяные знаки для соблюдения EU AI Act. Разбор механизма: как скрытое смещение вероятностей токенов превращается в детектируемую статистику.

Баннер новости 6648

Контекст: EU AI Act и обязательная маркировка

Внедрение водяных знаков (watermarking) в тексты, генерируемые большими языковыми моделями (LLM), перешло из категории экспериментальных технологий в разряд обязательных. Такие гиганты, как Claude, Gemini и ChatGPT, уже интегрируют эти механизмы для соответствия требованиям EU AI Act о прозрачности. Цель — создать статистический след, который невозможно заметить невооруженным глазом, но легко верифицировать алгоритмически, сохраняя при этом семантическую целостность текста.

Механика: «Зеленые» и «красные» токены

Суть метода заключается в мягком изменении процесса выборки токенов. Словарь модели условно делится на две группы на основе секретного ключа и контекста:

  • Зеленые токены (Green): получают небольшое преимущество в вероятности выбора.
  • Красные токены (Red): получают небольшое снижение вероятности.

В нормальных условиях вероятность выбора токена из «зеленой» группы составляет около 0.5. При активации водяного знака эта вероятность смещается, например, до 0.55. Для человека разница незаметна, но для детектора, знающего секретный ключ, это становится сигналом.

Статистическая модель: Проверка гипотез

Детектирование формулируется как задача проверки статистических гипотез. Мы сравниваем наблюдаемое количество «зеленых» токенов с тем, что ожидалось бы в случайном тексте.

Концепция Описание в контексте LLM Роль в детекции
H0 (Нулевая гипотеза) Текст сгенерирован без водяного знака (случайное распределение). Базовая линия для сравнения.
H1 (Альтернативная гипотеза) Текст содержит водяной знак (смещение в сторону «зеленых» токенов). Цель обнаружения.
Z-статистика Стандартизированное отклонение числа зеленых токенов от ожидаемого. Измеряет силу сигнала.
p-value Вероятность получить такой же результат при H0. Если p < α, отвергаем H0.
Уровень значимости (α) Максимально допустимая вероятность ложноположительного срабатывания (Type I error). Настройка чувствительности детектора.

Почему это важно для разработчиков и исследователей

Понимание водяных знаков как статистической проблемы, а не криптографической, меняет подход к их обходу и защите. Ключевые риски и метрики:

  • Type I Error (Ложное срабатывание): Обвинение человека в использовании ИИ, когда текст написан самостоятельно. Зависит от выбора α.
  • Type II Error (Пропуск): Неспособность обнаружить ИИ-текст. Зависит от статистической мощности (Statistical Power).
  • Центральная предельная теорема: Позволяет аппроксимировать распределение суммы токенов нормальным, что упрощает вычисления для длинных документов.

Этот подход обеспечивает масштабируемую проверку контента, но требует тщательной настройки баланса между ложными срабатываниями и пропусками, особенно при коротких фрагментах текста.

Источник: Towards AI pub ↗