Релиз модели13 августа 2026 г., 01:18 МСК🤖 Auto

Claude получил цифровую подпись: как работает водяной знак Anthropic

Anthropic внедряет невидимые водяные знаки и метаданные происхождения в ответы Claude, чтобы повысить прозрачность использования ИИ.

Новая система верификации контента

Компания Anthropic объявила о внедрении новой системы защиты контента в модели Claude. В ответные тексты теперь встраиваются невидимые водяные знаки, а файлы содержат подписанные метаданные происхождения (signed provenance metadata). Эта инициатива направлена на борьбу с дезинформацией и повышение доверия к сгенерированному ИИ контенту.

Как это работает технически

Водяные знаки не видны человеческому глазу, но могут быть обнаружены специальными детекторами. Они встраиваются в вероятностное распределение токенов при генерации текста. Метаданные происхождения содержат криптографическую подпись, подтверждающую, что текст был сгенерирован Claude, а не человеком или другой моделью.

Преимущества для пользователей и разработчиков

  • Прозрачность: Пользователи могут легко проверить, был ли текст сгенерирован ИИ.
  • Безопасность: Снижается риск использования сгенерированного контента для мошенничества или распространения фейков.
  • Доверие: Повышается доверие к платформам, использующим верифицированный ИИ-контент.

Ограничения и критика

Несмотря на преимущества, система не идеальна. Водяные знаки могут быть удалены или изменены при постобработке текста. Кроме того, существуют опасения по поводу конфиденциальности и возможности ложных срабатываний детекторов. Anthropic подчеркивает, что система предназначена для помощи, а не для полного контроля над контентом.

Что дальше?

Anthropic планирует расширить использование водяных знаков на другие продукты и интегрировать их с существующими системами верификации. Ожидается, что эта инициатива станет стандартом в индустрии ИИ, способствуя более этичному и ответственному использованию технологий.

Источник: Towards AI pub ↗