Исследования24 июля 2026 г., 23:17 МСК🤖 Auto

Intent Is All You Need: Как независимый исследователь обнаружил «намерение» в LLM без GPU

Автор под псевдонимом Not Sure создал интерпретируемость-фреймворк для Qwen и Llama, выявив структурные различия между базовыми моделями и их RLHF-версиями, используя только CPU и 32 ГБ ОЗУ.

Баннер новости 4330

Суть открытия: Поиск направления отказа (Refusal Direction)

Исследователь проанализировал модель Qwen-2.5-0.5B и её базовую версию, чтобы найти дифференциальные сигналы, возникающие после обучения с подкреплением на основе человеческих предпочтений (RLHF). Целью было не просто «выровнять» модель, а найти внутренний инстинкт, позволяющий модели распознавать опасные паттерны запросов на архитектурном уровне. Работа опирается на исследования Arditi et al. о так называемом «направлении отказа» (refusal direction), где показано, что безопасность модели можно представить как вектор в пространстве активаций.

Технические характеристики и инфраструктура

Главная особенность работы — отсутствие GPU и институциональной поддержки. Автор разработал кастомный движок вывода (inference engine) с квантованием и потоковой обработкой, который позволил запускать анализ на ресурсах, недоступных для типичных исследований. Была создана библиотека объемом 30 000 строк кода, включающая модульный пайплайн постобработки данных для исключения ложных срабатываний (confounds).

Параметр Значение / Описание
Анализируемые модели Qwen-2.5-0.5B, Llama (серия), модели до 27B+
Железо Двухъядерный CPU, 32 ГБ ОЗУ (без GPU)
Объем кода ~30 000 строк (интерпретируемость-фреймворк)
Методология Поиск «направления отказа», анализ аттракторных бассейнов, per-prompt анализ в реальном времени
Ограниченияtd> Для сложных случаев требуется многократное «бритье» (shaving) между инференсами; модели >70B требуют терпения

Почему это важно для AI Governance

Автор утверждает, что угроза со стороны интеллектуальных автономных систем сместилась от способности (capability) к намерению (intent). Если раньше риск зависел от того, может ли модель выполнить задачу, то теперь ключевым фактором становится то, как модель интерпретирует намерение пользователя и решает ли она выполнить запрос, основываясь на внутренних векторах безопасности. Обнаружение этих структурных сигналов позволяет создавать более прозрачные и предсказуемые системы контроля, не полагаясь исключительно на черные ящики RLHF.

Вывод

Работа демонстрирует, что глубокий анализ интерпретируемости (interpretability) доступен не только крупным лабораториям. Хотя для решения проблем безопасности на уровне >70B параметров потребуются более мощные вычислительные ресурсы, методология «легковесного» анализа уже позволяет выявлять фундаментальные сдвиги в поведении моделей после дообучения.

Источник: LessWrong ↗