Проблема: кража интеллектуальной собственности в AI
23 февраля 2026 года Anthropic опубликовала отчет, подтверждающий подозрения в том, что их передовые модели были дистиллированы (обучены на их выводах) китайскими разработчиками открытых весов. Несмотря на то, что Terms of Service OpenAI, Anthropic и Google прямо запрещают использование их данных для обучения конкурентов, юридические механизмы защиты отстают от технологий. Отсутствие прозрачных методов атрибуции позволяет нарушителям скрывать происхождение моделей.
Решение: Алгоритм «Digital Fingerprinting»
Исследователи Goutham Nalagatla и Carlos Guerrero Alvarez предложили метод внедрения невидимых подписей в модель-учитель (Teacher Model) во время дообучения. Ключевая идея заключается в том, что эти подписи сохраняются в распределении токенов и передаются модели-студенту (Student Model) в процессе дистилляции, что позволяет детектировать факт копирования.
Механизм работает следующим образом:
- Выбор нейронов: Алгоритм выделяет топ-K нейронов, которые активируются с частотой от 1% до 50% (исключая слишком общие, как «the», и слишком редкие).
- Генерация отпечатков: Для каждого нейрона генерируется уникальный хеш SHA-256.
- Сдвиг логарифмической вероятности (Log prob shift): Активация конкретного нейрона вызывает микро-изменение вероятности выбора 256 случайных токенов в выходном слое. Это изменение кодируется вектором значений {+1, -1}.
- LoRA-дообучение: Модель обучается так, чтобы при срабатывании выбранного нейрона применялся соответствующий сдвиг вероятностей, не ухудшая при этом базовые способности модели (контролируется через KL-divergence).
Экспериментальные данные
Для проверки гипотезы исследователи использовали архитектуру Qwen 2.5. Модель-учитель (7B параметров) была «зашифрована» с помощью описанного метода, после чего на её выводах была обучена модель-студент (1.5B параметров). Датасет для обучения — PG-19.
| Параметр | Значение / Описание |
|---|---|
| Teacher Model | Qwen2.5-7B (18,944 нейронов на слой) |
| Student Model | Qwen2.5-1.5B |
| Метод дистилляции | Logit-based и Hard-label |
| Размер словаря | 151,643 токенов |
| Кодирование отпечатка | 256 случайных токенов, сдвиг вероятности через вектор {+1, -1} |
| Результат | Успешное обнаружение дистилляции в обеих моделях |
Почему это важно
Предложенный алгоритм не предотвращает саму кражу данных, но делает её обнаружение практически неизбежным. Если модель X была дистиллирована из модели Y, декодер сможет найти в выводах X уникальные статистические аномалии, привязанные к нейронам Y. Это создает основу для атрибуции: компании смогут доказывать в суде или публично заявлять о факте использования их интеллектуальной собственности. Метод применим как к логит-базированной, так и к hard-label дистилляции, что делает его универсальным инструментом для индустрии.
Источник: LessWrong ↗
