Проблема белых ящиков
Существующие методы водяных знаков для больших языковых моделей (LLM) часто полагаются на изменение вероятностей выборки токенов во время генерации. Это эффективно для проприетарных моделей с закрытым доступом, но бесполезно для open-source решений. Пользователи, имеющие полный доступ к весам модели (white-box access), могут легко отключить или обойти такие защитные механизмы на этапе инференса.
Решение: Встраивание в unembedding-слой
Команда разработчиков во главе с Мировином Бакши (Miroojin Bakshi) предложила архитектуру OpenStamp. Ключевое отличие метода заключается в том, что логика водяного знака кодируется непосредственно в веса модели путем модификации только финального проекционного слоя (unembedding layer). Это позволяет сохранить «черный ящик» для пользователя, но при этом гарантированно обнаруживать сгенерированный текст.
Результаты и устойчивость
Эксперименты показали, что OpenStamp обеспечивает превосходное качество обнаружения при минимальной деградации базовых способностей модели. Водяной знак спроектирован так, чтобы быть устойчивым к атакам перефразирования (paraphrasing attacks) и значительно сложнее удаляется при пост-фактум дообучении (post-hoc fine-tuning) по сравнению с предыдущими методами для open-source моделей.
Доступность и внедрение
Для стимулирования внедрения технологии авторы опубликовали код и подготовили версии четырех популярных open-source моделей с уже внедренным водяным знаком. Работа опубликована в репозитории arXiv и принята к публикации на конференции COLM 2026.
| Характеристика | OpenStamp | Традиционные методы (probabilistic) |
|---|---|---|
| Место внедрения | Веса модели (unembedding layer) | Логика выборки токенов (inference time) |
| Уязвимость к white-box | Низкая (требует изменения весов) | Высокая (легко отключить) |
| Устойчивость к перефразированию | Высокая | Средняя/Низкая |
| Влияние на качество модели | Минимальная деградация | Зависит от метода |
Источник: arXiv cs.CL ↗
