Механизм скрытия данных в вероятностях
Anthropic представила новую систему водяных знаков, которая работает не через явные метки, а путем тонкой настройки распределения вероятностей при генерации текста. Алгоритм вносит микроскопические изменения в выбор следующего токена, создавая статистический паттерн, который невозможно заметить при чтении, но легко детектируется специальными инструментами. Это позволяет отличать контент, сгенерированный Claude, от человеческого или созданного другими моделями.
Устойчивость к редактированию и перефразированию
Ключевой вопрос безопасности — возможность обхода водяных знаков путем простого редактирования текста. Anthropic подчеркивает, что их система разработана с учетом атак типа "paraphrasing" (перефразирование). Даже если пользователь изменит структуру предложений или заменит синонимы, статистический отпечаток модели сохраняется. Это делает систему значительно более надежной по сравнению с предыдущими попытками внедрения водяных знаков в LLM, которые часто ломались при минимальной правке текста.
Влияние на генерацию кода
Особое внимание уделено применению технологии к программированию. Водяные знаки в коде внедряются через выбор альтернативных, но функционально эквивалентных конструкций (например, использование разных типов циклов или переменных), которые не влияют на работоспособность скрипта, но сохраняют статистический след. Это важно для отслеживания происхождения программного обеспечения, созданного с помощью AI, в корпоративной среде.
Технические характеристики и метрики
Anthropic не раскрывает точных математических параметров алгоритма, чтобы предотвратить его обход злоумышленниками. Однако компания заявляет, что система сохраняет высокую точность детекции (более 95% в контролируемых тестах) при минимальном влиянии на качество генерации. Водяные знаки не замедляют процесс инференса и не увеличивают стоимость запросов для пользователей.
| Параметр | Значение/Описание |
|---|---|
| Метод внедрения | Изменение распределения вероятностей токенов |
| Устойчивость к редактированию | Высокая (сохраняется при перефразировании) |
| Влияние на код | Использование функционально эквивалентных конструкций |
| Точность детекции | Более 95% (в контролируемых условиях) |
| Производительность | Без задержек и дополнительных затрат |
Почему это важно
Внедрение таких систем становится стандартом для крупных AI-лабораторий в ответ на растущие требования регуляторов и общества к прозрачности использования искусственного интеллекта. Для разработчиков и компаний это означает новые инструменты верификации контента, а для пользователей — необходимость понимания того, как их взаимодействие с AI может быть отслежено.
Источник: TechCrunch ↗
