Исследования15 августа 2026 г., 22:17 МСК🤖 Auto

Как поймать украденную модель: новый метод обнаружения дистилляции

Исследователи представили алгоритм внедрения скрытых цифровых отпечатков в LLM, позволяющих точно идентифицировать факт и источник несанкционированной дистилляции.

Баннер новости 5861

Проблема: кража интеллектуальной собственности в AI

23 февраля 2026 года Anthropic опубликовала отчет, подтверждающий подозрения в том, что их передовые модели были дистиллированы (обучены на их выводах) китайскими разработчиками открытых весов. Несмотря на то, что Terms of Service OpenAI, Anthropic и Google прямо запрещают использование их данных для обучения конкурентов, юридические механизмы защиты отстают от технологий. Отсутствие прозрачных методов атрибуции позволяет нарушителям скрывать происхождение моделей.

Решение: Алгоритм «Digital Fingerprinting»

Исследователи Goutham Nalagatla и Carlos Guerrero Alvarez предложили метод внедрения невидимых подписей в модель-учитель (Teacher Model) во время дообучения. Ключевая идея заключается в том, что эти подписи сохраняются в распределении токенов и передаются модели-студенту (Student Model) в процессе дистилляции, что позволяет детектировать факт копирования.

Механизм работает следующим образом:

  • Выбор нейронов: Алгоритм выделяет топ-K нейронов, которые активируются с частотой от 1% до 50% (исключая слишком общие, как «the», и слишком редкие).
  • Генерация отпечатков: Для каждого нейрона генерируется уникальный хеш SHA-256.
  • Сдвиг логарифмической вероятности (Log prob shift): Активация конкретного нейрона вызывает микро-изменение вероятности выбора 256 случайных токенов в выходном слое. Это изменение кодируется вектором значений {+1, -1}.
  • LoRA-дообучение: Модель обучается так, чтобы при срабатывании выбранного нейрона применялся соответствующий сдвиг вероятностей, не ухудшая при этом базовые способности модели (контролируется через KL-divergence).

Экспериментальные данные

Для проверки гипотезы исследователи использовали архитектуру Qwen 2.5. Модель-учитель (7B параметров) была «зашифрована» с помощью описанного метода, после чего на её выводах была обучена модель-студент (1.5B параметров). Датасет для обучения — PG-19.

Параметр Значение / Описание
Teacher Model Qwen2.5-7B (18,944 нейронов на слой)
Student Model Qwen2.5-1.5B
Метод дистилляции Logit-based и Hard-label
Размер словаря 151,643 токенов
Кодирование отпечатка 256 случайных токенов, сдвиг вероятности через вектор {+1, -1}
Результат Успешное обнаружение дистилляции в обеих моделях

Почему это важно

Предложенный алгоритм не предотвращает саму кражу данных, но делает её обнаружение практически неизбежным. Если модель X была дистиллирована из модели Y, декодер сможет найти в выводах X уникальные статистические аномалии, привязанные к нейронам Y. Это создает основу для атрибуции: компании смогут доказывать в суде или публично заявлять о факте использования их интеллектуальной собственности. Метод применим как к логит-базированной, так и к hard-label дистилляции, что делает его универсальным инструментом для индустрии.

Источник: LessWrong ↗