Исследования1 сентября 2026 г., 04:17 МСК🤖 Auto

OpenStamp: Встраиваем водяной знак в веса LLM, чтобы его не стереть

Исследователи представили OpenStamp — метод водяных знаков для open-source моделей, который встраивает сигнал прямо в веса нейросети, делая его устойчивым к перефразированию и дообучению.

Баннер новости 6462

Проблема белых ящиков

Существующие методы водяных знаков для больших языковых моделей (LLM) часто полагаются на изменение вероятностей выборки токенов во время генерации. Это эффективно для проприетарных моделей с закрытым доступом, но бесполезно для open-source решений. Пользователи, имеющие полный доступ к весам модели (white-box access), могут легко отключить или обойти такие защитные механизмы на этапе инференса.

Решение: Встраивание в unembedding-слой

Команда разработчиков во главе с Мировином Бакши (Miroojin Bakshi) предложила архитектуру OpenStamp. Ключевое отличие метода заключается в том, что логика водяного знака кодируется непосредственно в веса модели путем модификации только финального проекционного слоя (unembedding layer). Это позволяет сохранить «черный ящик» для пользователя, но при этом гарантированно обнаруживать сгенерированный текст.

Результаты и устойчивость

Эксперименты показали, что OpenStamp обеспечивает превосходное качество обнаружения при минимальной деградации базовых способностей модели. Водяной знак спроектирован так, чтобы быть устойчивым к атакам перефразирования (paraphrasing attacks) и значительно сложнее удаляется при пост-фактум дообучении (post-hoc fine-tuning) по сравнению с предыдущими методами для open-source моделей.

Доступность и внедрение

Для стимулирования внедрения технологии авторы опубликовали код и подготовили версии четырех популярных open-source моделей с уже внедренным водяным знаком. Работа опубликована в репозитории arXiv и принята к публикации на конференции COLM 2026.

Характеристика OpenStamp Традиционные методы (probabilistic)
Место внедрения Веса модели (unembedding layer) Логика выборки токенов (inference time)
Уязвимость к white-box Низкая (требует изменения весов) Высокая (легко отключить)
Устойчивость к перефразированию Высокая Средняя/Низкая
Влияние на качество модели Минимальная деградация Зависит от метода

Источник: arXiv cs.CL ↗