Исследования21 августа 2026 г., 23:19 МСК🤖 Auto

Антропик внедрил водяные знаки в Claude: цена — ноль, споры — миллионы

Anthropic внедрил криптографическое водяное знакивание в модели Claude для соответствия регламенту ЕС. Метод, разработанный Скоттом Аронсоном, не влияет на качество текста, но вызвал бурную реакцию сообщества.

Баннер новости 6270

Суть технологии: математика, а не метки

В отличие от очевидных надписей «Сгенерировано ИИ», новый метод использует криптографический подход, разработанный Скоттом Аронсоном и Хендриком Кирхнером. Алгоритм работает на уровне вероятностей выбора токенов:

  • Принцип: Модель использует секретный ключ для генерации псевдослучайного числа. Выбор следующего токена происходит из распределения, слегка смещенного в сторону «водо знаков».
  • Обнаружение: Специальный API анализирует текст и вычисляет статистику: насколько сильно выбор токенов соответствует секретному ключу, а не случайному распределению.
  • Прозрачность: Метод не меняет семантику или стиль текста. Человек не может отличить «заводной» текст от обычного.

Контекст и метрики

Google уже внедряет аналогичное решение с 2024 года, включая модель Gemini 3.7 Flash. Anthropic теперь делает то же самое для соблюдения Кодекса практики ЕС (EU Code of Practice). Ключевые факты:

  • Стоимость: Маржинальные затраты на внедрение близки к нулю.
  • Тесты Google: На выборке из 20 миллионов запросов не зафиксировано разницы в пользовательской обратной связи (feedback) между помеченным и обычным текстом.
  • Уязвимость: Водяной знак можно удалить, полностью переписав текст своими словами. Он сохраняется пропорционально тому, сколько оригинальных решений ИИ оставлено в тексте.

Почему это важно для индустрии

Внедрение маркировки создает прецедент прозрачности. Если ИИ-модели становятся неотличимы от человеческого текста, водяные знаки становятся единственным техническим инструментом верификации источника. Это критично для борьбы с дезинформацией и защиты авторских прав, так как позволяет отличать оригинальный контент от сгенерированного.

Реакция сообщества: «Синдром отчуждения от Anthropic»

Несмотря на технические преимущества, новость вызвала резонанс. Автор анализа Zvi Mowshowitz выделяет несколько причин негативной реакции:

  1. Предвзятость к бренду: Люди реагируют не на технологию (которую Google использует уже 2 года), а на Anthropic, воспринимая их действия как скрытые или зловещие.
  2. Непонимание рандомизации: Многие пользователи ошибочно полагают, что ИИ выдает «единственно верный» детерминированный ответ, и любое вмешательство считают деградацией качества.
  3. Страх анонимности: Часть аудитории использует ИИ для создания контента без указания авторства, что рассматривается как этическая проблема (отсутствие кредита автору).

Сравнение подходов к маркировке

Критерий Криптографический водяной знак (Anthropic/Google) Параметрическая маркировка (Pangram Labs)
Метод Смещение вероятностей токенов на этапе генерации Обучение классификатора на стилях текста
Влияние на качество Нулевое (незаметно для человека) Минимальное, но требует дообучения
Устойчивость к переписыванию Снижается пропорционально изменениям Выше (лучше справляется с легкими правками)
Статус Требование EU Code of Practice Добровольная инициатива

Технически решение является «бесплатным и хорошим» (free and good) с точки зрения затрат и полезности, однако социальное принятие требует времени и объяснения природы работы LLM-моделей.

Источник: LessWrong ↗