Проблема: слепая зона в безопасности AI
Количество сообщений о сгенерированном ИИ материале сексуального насилия над детьми (CSAM) резко возросло: с 67 000 в 2024 году до более чем 1,5 млн в 2025 году (данные Национального центра по пропавшим и эксплуатируемым детям). Традиционный метод аудита — промптинг модели для получения запрещенного контента — стал невозможен юридически, так как генерация CSAM незаконна в США и многих других юрисдикциях, независимо от намерений.
Решение: Gaussian probing
Команда MIT во главе с аспирантом Винитом Суриякумаром и исследователями из организации Thorn разработала метод, анализирующий внутренние изменения модели (LoRA-адаптеры) без вывода конечного изображения. Метод использует гауссово зондирование: в модель вводятся случайные данные, и анализируется, как многослойная структура обрабатывает их. Это позволяет определить, была ли модель специализирована на генерацию вредоносного контента, не генерируя его физически.
Результаты тестирования
Метод был протестирован на вариациях трех типов моделей. Результаты показали абсолютную эффективность в выявлении вредоносных адаптаций. Ниже приведено сравнение эффективности подхода:
| Метод аудита | Требует генерации контента | Юридическая безопасность | Точность выявления CSAM |
|---|---|---|---|
| Традиционный промптинг | Да | Нет (нарушение закона) | Не применимо |
| Gaussian probing (MIT/Thorn) | Нет | Да | 100% |
Значение для индустрии
Технология масштабируема и экономически эффективна, что критично для хостинг-платформ, публикующих тысячи моделей в месяц. Она позволяет блокировать загрузку опасных моделей до их распространения. Исследование представлено в формате spotlight на воркшопе «Trustworthy AI for Good» в рамках Международной конференции по машинному обучению (ICML).
Источник: MIT News AI ↗
