Суть технологии: математика, а не метки
В отличие от очевидных надписей «Сгенерировано ИИ», новый метод использует криптографический подход, разработанный Скоттом Аронсоном и Хендриком Кирхнером. Алгоритм работает на уровне вероятностей выбора токенов:
- Принцип: Модель использует секретный ключ для генерации псевдослучайного числа. Выбор следующего токена происходит из распределения, слегка смещенного в сторону «водо знаков».
- Обнаружение: Специальный API анализирует текст и вычисляет статистику: насколько сильно выбор токенов соответствует секретному ключу, а не случайному распределению.
- Прозрачность: Метод не меняет семантику или стиль текста. Человек не может отличить «заводной» текст от обычного.
Контекст и метрики
Google уже внедряет аналогичное решение с 2024 года, включая модель Gemini 3.7 Flash. Anthropic теперь делает то же самое для соблюдения Кодекса практики ЕС (EU Code of Practice). Ключевые факты:
- Стоимость: Маржинальные затраты на внедрение близки к нулю.
- Тесты Google: На выборке из 20 миллионов запросов не зафиксировано разницы в пользовательской обратной связи (feedback) между помеченным и обычным текстом.
- Уязвимость: Водяной знак можно удалить, полностью переписав текст своими словами. Он сохраняется пропорционально тому, сколько оригинальных решений ИИ оставлено в тексте.
Почему это важно для индустрии
Внедрение маркировки создает прецедент прозрачности. Если ИИ-модели становятся неотличимы от человеческого текста, водяные знаки становятся единственным техническим инструментом верификации источника. Это критично для борьбы с дезинформацией и защиты авторских прав, так как позволяет отличать оригинальный контент от сгенерированного.
Реакция сообщества: «Синдром отчуждения от Anthropic»
Несмотря на технические преимущества, новость вызвала резонанс. Автор анализа Zvi Mowshowitz выделяет несколько причин негативной реакции:
- Предвзятость к бренду: Люди реагируют не на технологию (которую Google использует уже 2 года), а на Anthropic, воспринимая их действия как скрытые или зловещие.
- Непонимание рандомизации: Многие пользователи ошибочно полагают, что ИИ выдает «единственно верный» детерминированный ответ, и любое вмешательство считают деградацией качества.
- Страх анонимности: Часть аудитории использует ИИ для создания контента без указания авторства, что рассматривается как этическая проблема (отсутствие кредита автору).
Сравнение подходов к маркировке
| Критерий | Криптографический водяной знак (Anthropic/Google) | Параметрическая маркировка (Pangram Labs) |
|---|---|---|
| Метод | Смещение вероятностей токенов на этапе генерации | Обучение классификатора на стилях текста |
| Влияние на качество | Нулевое (незаметно для человека) | Минимальное, но требует дообучения |
| Устойчивость к переписыванию | Снижается пропорционально изменениям | Выше (лучше справляется с легкими правками) |
| Статус | Требование EU Code of Practice | Добровольная инициатива |
Технически решение является «бесплатным и хорошим» (free and good) с точки зрения затрат и полезности, однако социальное принятие требует времени и объяснения природы работы LLM-моделей.
Источник: LessWrong ↗
