Исследования18 августа 2026 г., 20:18 МСК🤖 Auto

MIT: В больших ИИ-моделях исчезает связь между данными и результатом

Исследователи MIT CSAIL доказали: при обучении на миллионах изображений вклад отдельного автора в итоговый генеративный результат стремится к нулю. Это ставит под угрозу текущие судебные иски о копирайте.

Баннер новости 6016

Эффект «атрибутивного распада»

Команда MIT Computer Science and Artificial Intelligence Laboratory (CSAIL) под руководством профессора Дэвида Гиффорда (David Gifford) и исследователя Чжэн Дая (Zheng Dai) опубликовала в Nature Communications работу, опровергающую интуитивное представление о том, что ИИ-генераторы «запоминают» отдельные изображения. Ученые выявили феномен attribution decay (атрибутивный распад): по мере роста датасета влияние любого конкретного примера на выход модели становится статистически незначимым.

Суть метода проста, но революционна: вместо приблизительных оценок влияния (approximations), которые использовались ранее, исследователи создали архитектуру «diffusion ensemble». Это не одна монолитная нейросеть, а ансамбль из множества небольших компонентов, каждый из которых обучен на своей части данных. Чтобы проверить, как модель сгенерирует изображение без конкретного кадра, ученые просто «отключали» соответствующие части ансамбля. Это позволило получить точный контрфактический результат без переобучения модели с нуля.

Эксперимент: от 256 до 160 000 изображений

Для проверки гипотезы команда обучила 24 ансамблевые модели на наборах данных от 256 до более чем 160 000 изображений, используя публичные коллекции: CIFAR-10, CelebA, MetFaces и ArtBench. Они измеряли «контрфактический радиус» — максимальное возможное изменение выходного изображения при удалении любого единичного примера из обучающей выборки.

Результаты показали четкую закономерность: с ростом объема данных этот радиус сокращается по закону обратных степеней. Удаление работ конкретного художника или фотографий конкретного человека не приводило к заметным изменениям в сгенерированных изображениях. Ниже приведены ключевые метрики сравнения эффективности метода:

Параметр Значение / Наблюдение Значимость
Архитектура Diffusion Ensemble (ансамбль диффузионных моделей) Позволяет точечное удаление данных без переобучения
Объем датасета 256 – 160 000+ изображений Тестировалось на 7 публичных коллекциях
Качество генерации Сопоставимо с vanilla-моделями При больших данных ансамбли даже эффективнее по использованию данных
Точность удаления 100% (exact method) В отличие от прошлых методов, это не аппроксимация, а реальное исключение влияния
Результат Атрибутивный распад Вклад отдельного примера в итоговый пиксель стремится к нулю

Юридические и этические последствия

Найденный эффект имеет прямое отношение к глобальным судебным искам от художников и правообладателей. Если вывод модели не зависит от конкретного тренировочного примера, то технически невозможно доказать, что сгенерированное изображение является «производным произведением» (derivative work) чьей-то конкретной работы. Как отмечает Дэвид Гиффорд, это может стать аргументом в пользу того, что ИИ-генерация — это создание принципиально нового контента, а не копирование.

Профессор права Корнеллского университета Джеймс Гриммельманн (James Grimmelmann) отмечает, что если атрибуция не работает, судам и технологам придется искать другие методы оценки копирования. Кроме того, исследователи предлагают индустрии использовать этот метод не как лазейку, а как инструмент для гарантированного создания контента, который не может быть отнесен к чьей-либо личной авторской работе, что может стать стандартом для защиты от исков о нарушении авторских прав.

Что дальше?

Работа сосредоточена на диффузионных моделях, доминирующих в генерации изображений. Вопрос о том, сохраняется ли эффект атрибутивного распада для больших языковых моделей (LLM), которые находятся в центре самых громких судебных разбирательств, остается открытым. Однако методология «diffusion ensemble» открывает путь к созданию более прозрачных и юридически защищенных ИИ-систем, где можно точно доказать отсутствие связи с конкретными источниками данных.

Источник: MIT News AI ↗