Суть открытия: Поиск направления отказа (Refusal Direction)
Исследователь проанализировал модель Qwen-2.5-0.5B и её базовую версию, чтобы найти дифференциальные сигналы, возникающие после обучения с подкреплением на основе человеческих предпочтений (RLHF). Целью было не просто «выровнять» модель, а найти внутренний инстинкт, позволяющий модели распознавать опасные паттерны запросов на архитектурном уровне. Работа опирается на исследования Arditi et al. о так называемом «направлении отказа» (refusal direction), где показано, что безопасность модели можно представить как вектор в пространстве активаций.
Технические характеристики и инфраструктура
Главная особенность работы — отсутствие GPU и институциональной поддержки. Автор разработал кастомный движок вывода (inference engine) с квантованием и потоковой обработкой, который позволил запускать анализ на ресурсах, недоступных для типичных исследований. Была создана библиотека объемом 30 000 строк кода, включающая модульный пайплайн постобработки данных для исключения ложных срабатываний (confounds).
| Параметр | Значение / Описание |
|---|---|
| Анализируемые модели | Qwen-2.5-0.5B, Llama (серия), модели до 27B+ |
| Железо | Двухъядерный CPU, 32 ГБ ОЗУ (без GPU) |
| Объем кода | ~30 000 строк (интерпретируемость-фреймворк) |
| Методология | Поиск «направления отказа», анализ аттракторных бассейнов, per-prompt анализ в реальном времени |
| Ограниченияtd> | Для сложных случаев требуется многократное «бритье» (shaving) между инференсами; модели >70B требуют терпения |
Почему это важно для AI Governance
Автор утверждает, что угроза со стороны интеллектуальных автономных систем сместилась от способности (capability) к намерению (intent). Если раньше риск зависел от того, может ли модель выполнить задачу, то теперь ключевым фактором становится то, как модель интерпретирует намерение пользователя и решает ли она выполнить запрос, основываясь на внутренних векторах безопасности. Обнаружение этих структурных сигналов позволяет создавать более прозрачные и предсказуемые системы контроля, не полагаясь исключительно на черные ящики RLHF.
Вывод
Работа демонстрирует, что глубокий анализ интерпретируемости (interpretability) доступен не только крупным лабораториям. Хотя для решения проблем безопасности на уровне >70B параметров потребуются более мощные вычислительные ресурсы, методология «легковесного» анализа уже позволяет выявлять фундаментальные сдвиги в поведении моделей после дообучения.
Источник: LessWrong ↗
