Исследования5 июля 2026 г., 20:16 МСК🤖 Auto

Scientist AI: Проверка гипотезы безопасности на Llama-3.1

Анализ ландшафта потерь Llama-3.1-8B показал, что опасные состояния модели занимают ничтожный объем в пространстве параметров, но существуют «плоские» направления, снижающие безопасность без роста ошибки.

Баннер новости 2931

Суть исследования

Алехандро Тлаи (Alejandro Tlaie) провел эмпирическую проверку теоретической работы Bengio et al. (2026) о безопасности «Scientist AI» (SAI). Ключевое предположение SAI — гипотеза разреженности полосы потерь (loss-band sparsity): вероятность того, что случайная инициализация или обучение приведет к «опасному» предиктору, пренебрежимо мала, так как такие состояния занимают крошечный объем в пространстве параметров.

Автор проверил эту гипотезу на модели Llama-3.1-8B-Instruct (4-bit quantization) с использованием LoRA-адаптеров. Эксперимент заключался в генерации 117 случайных возмущений параметров, сохраняющих уровень потерь (cross-entropy loss) в заданном диапазоне, и оценке их «безопасности» через метрику отказа (refusal margin) на наборе AdvBench.

Ключевые метрики и результаты

Исследование выявило два важных факта. Во-первых, локальная доля опасных моделей равна нулю. Ни одно из 117 принятых возмущений не привело к падению маржи отказа ниже нуля. Во-вторых, обнаружена асимметрия кривизны: направления, ведущие к снижению безопасности, являются «плоскими» (требуют меньшего изменения потерь), чем случайные направления.

Параметр экспериментаЗначение / РезультатИнтерпретация
МодельLlama-3.1-8B-Instruct (4-bit, LoRA r=8)Базовая архитектура для тестирования
Объем выборки117 принятых сэмпловВозмущения, сохранившие уровень потерь
Минимальная маржа отказа+0.98 natsНи один образец не стал «опасным» (порог 0)
Верхняя граница 95% CI (доля опасных)3.2%Подтверждение гипотезы разреженности
Коэффициент кривизны (наиболее подавленный)0.73 [0.69, 0.78]Опасные направления «плосче» случайных на 27%
Статистическая значимость кривизныp = 0.067 (для 2/30 направлений)Тренд есть, но не является универсальным для всех сэмплов

Почему это важно

Результаты подтверждают, что опасные модели находятся «близко» к безопасным (как показано в других работах по хрупкости дообучения), но они занимают ничтожный объем в пространстве параметров. Это поддерживает аргумент SAI о том, что случайные блуждания в пространстве параметров с высокой вероятностью не приведут к катастрофическому поведению.

Однако обнаруженный эффект «плоской кривизны» (curvature ratio < 1) указывает на потенциальную уязвимость: градиентные методы оптимизации, движущиеся в направлении снижения безопасности, могут делать это с меньшим «штрафом» в виде роста потерь, чем случайные изменения. Это создает риск, что целенаправленные атаки или специфические паттерны обучения смогут обойти механизмы безопасности, даже если такие состояния редки в случайной выборке.

Ограничения

Эксперимент проведен на одной модели и одном подпространстве (LoRA). Наблюдение о кривизне не обобщается статистически значимо на всю популяцию принятых сэмплов (Spearman correlation p=0.16), что указывает на необходимость более масштабных исследований ландшафта потерь для разных архитектур.

Источник: LessWrong ↗