Исследования12 сентября 2026 г., 06:18 МСК🤖 Auto

Миф о памяти LLM: почему модели «помнят» только вирусные тексты

Исследование Arman Nik Khah доказывает: LLM не запоминают тренировочные данные, пока они не станут вирусными. Обычная дубликация текста не оставляет следа в модели.

Баннер новости 7329

Конец эпохи догадок: точные данные о дубликатах

Проблема определения членства в обучающей выборке (membership inference) долгое время страдала от методологических ошибок: исследователи не могли точно знать, какие именно предложения были в корпусе модели. Статья «Detectable Only Where It Is Confounded» решает эту проблему, используя открытые предобученные корпуса моделей OLMo-2 и Pythia. Автор получил точные индексы, показывающие, сколько раз каждое предложение встречалось в данных.

Это позволило провести «клещевую атаку» на гипотезу о памяти моделей. Результаты оказались неожиданными: при уровнях дубликации, характерных для обычного текста, модели от 1B до 13B параметров несут лишь слабые следы своей экспозиции.

Эксперимент: ранговая корреляция близка к нулю

Для измерения «следа» автор использовал метод, исключающий влияние качества текста. Одно и то же предложение пропускалось через две разные модели, что нивелировало разницу в их «беглости» (fluency). Результатом стала ранговая корреляция около -0.08 (где -1 — идеальная связь, а 0 — её отсутствие). Это означает, что модель не различает, было ли предложение в обучающих данных, если оно не является уникальным или редким.

Порог в 1000 копий: память как функция известности

Сигнал о членстве становится сильным только при превышении порога в ~1000 копий одного и того же предложения. В этой зоне обе модели (OLMo-2 и Pythia) сходятся в том, какие именно предложения они «помнят». Это происходит потому, что такие тексты — это известные, вирусные фразы. Таким образом, модель не запоминает факт обучения, а реагирует на известность текста.

Ложные срабатывания: стиль важнее памяти

Исследование также показывает, как искусственно создается сигнал членства. При замене одного слова в оригинальном предложении модель действительно предпочитает оригинал, но разрыв в вероятностях одинаков, независимо от того, встречалось ли оригинальное предложение 1 раз или 100 раз. Модель вознаграждает авторский выбор слов, а не память.

Метрика / Условие Результат Интерпретация
Ранговая корреляция (2 модели) ~ -0.08 Отсутствие связи между дубликацией и «памятью»
Порог сильного сигнала > 1000 копий Модель реагирует на известность (fame), а не на факт обучения
AUC детектора (сдвиг регистра) 0.83 → 0.94 Ложные срабатывания легко управляются контекстом
Разрыв вероятностей (1 слово) Постоянен Модель ценит стиль, а не частоту в данных

Почему это важно

Результаты ставят под сомнение использование вероятностных оценок для защиты приватности или проверки авторства. Если модель «помнит» только то, что стало вирусным, то обычные пользовательские данные не оставляют детектируемого следа в современных LLM. Автор опубликовал код и банки предложений для воспроизведения результатов.

Источник: arXiv cs.CL ↗