Суть исследования
Алехандро Тлаи (Alejandro Tlaie) провел эмпирическую проверку теоретической работы Bengio et al. (2026) о безопасности «Scientist AI» (SAI). Ключевое предположение SAI — гипотеза разреженности полосы потерь (loss-band sparsity): вероятность того, что случайная инициализация или обучение приведет к «опасному» предиктору, пренебрежимо мала, так как такие состояния занимают крошечный объем в пространстве параметров.
Автор проверил эту гипотезу на модели Llama-3.1-8B-Instruct (4-bit quantization) с использованием LoRA-адаптеров. Эксперимент заключался в генерации 117 случайных возмущений параметров, сохраняющих уровень потерь (cross-entropy loss) в заданном диапазоне, и оценке их «безопасности» через метрику отказа (refusal margin) на наборе AdvBench.
Ключевые метрики и результаты
Исследование выявило два важных факта. Во-первых, локальная доля опасных моделей равна нулю. Ни одно из 117 принятых возмущений не привело к падению маржи отказа ниже нуля. Во-вторых, обнаружена асимметрия кривизны: направления, ведущие к снижению безопасности, являются «плоскими» (требуют меньшего изменения потерь), чем случайные направления.
| Параметр эксперимента | Значение / Результат | Интерпретация |
|---|---|---|
| Модель | Llama-3.1-8B-Instruct (4-bit, LoRA r=8) | Базовая архитектура для тестирования |
| Объем выборки | 117 принятых сэмплов | Возмущения, сохранившие уровень потерь |
| Минимальная маржа отказа | +0.98 nats | Ни один образец не стал «опасным» (порог 0) |
| Верхняя граница 95% CI (доля опасных) | 3.2% | Подтверждение гипотезы разреженности |
| Коэффициент кривизны (наиболее подавленный) | 0.73 [0.69, 0.78] | Опасные направления «плосче» случайных на 27% |
| Статистическая значимость кривизны | p = 0.067 (для 2/30 направлений) | Тренд есть, но не является универсальным для всех сэмплов |
Почему это важно
Результаты подтверждают, что опасные модели находятся «близко» к безопасным (как показано в других работах по хрупкости дообучения), но они занимают ничтожный объем в пространстве параметров. Это поддерживает аргумент SAI о том, что случайные блуждания в пространстве параметров с высокой вероятностью не приведут к катастрофическому поведению.
Однако обнаруженный эффект «плоской кривизны» (curvature ratio < 1) указывает на потенциальную уязвимость: градиентные методы оптимизации, движущиеся в направлении снижения безопасности, могут делать это с меньшим «штрафом» в виде роста потерь, чем случайные изменения. Это создает риск, что целенаправленные атаки или специфические паттерны обучения смогут обойти механизмы безопасности, даже если такие состояния редки в случайной выборке.
Ограничения
Эксперимент проведен на одной модели и одном подпространстве (LoRA). Наблюдение о кривизне не обобщается статистически значимо на всю популяцию принятых сэмплов (Spearman correlation p=0.16), что указывает на необходимость более масштабных исследований ландшафта потерь для разных архитектур.
Источник: LessWrong ↗
