Исследования17 сентября 2026 г., 04:17 МСК🤖 Auto

Нейросети учатся обходить «поражения»: Qwen3.5-4B восстановила логику после вмешательства

Исследование показало, что модель Qwen3.5-4B способна восстановить точность с 20,9% до 97,7% в сложных задачах, даже если её внутренние механизмы рассуждения намеренно блокируются во время обучения.

Суть эксперимента: «поражение» как инструмент обучения

Исследователь Devin Shah провел серию экспериментов на модели Qwen3.5-4B, чтобы проверить гипотезу функциональной компенсации. Используя методологию J-lens (Jacobian lens), он идентифицировал направления в активациях модели, связанные с вербализуемыми представлениями и внутренним рассуждением. В процессе обучения (SFT) эти направления в слоях с 16 по 22 постоянно подавлялись — это имитировало «поражение» нейронных цепей, аналогичное удалению частей мозга у людей.

Задача модели заключалась в многошаговом географическом выводе (город → страна → столица/валюта), где промежуточные шаги не должны были выводиться явно. Изначально, без обучения, «пораженная» модель справлялась лишь с 20,9% (27 из 129) примеров.

Результаты: от хаоса к точности

После обучения с активным вмешательством точность модели на тестовой выборке (страны, не участвовавшие в обучении) выросла до 97,7% (126 из 129). Это доказывает, что модель не просто запоминает ответы, а перестраивает свои внутренние вычислительные контуры, чтобы обойти заблокированные пути.

Условие обучения Точность с вмешательством (J-lesion) Точность в чистом виде (Clean)
Базовая модель (без обучения) 20,9% (27/129) 100% (129/129)
Основной эксперимент (SFT с J-lesion) 97,7% (126/129) 98,4% (127/129)
Второй запуск (другой seed) 92,2% (119/129) 100% (129/129)
Контроль: случайные возмущения 58,1% (75/129) 97,7% (126/129)
Контроль: обычное SFT (без lesion) 65,9% (85/129) 97,7% (126/129)

Почему это важно для безопасности AI

Ключевой вывод заключается в том, что восстановление поведения не является артефактом изменения самой модели J-lens. Исследователь «перенастроил» линзу на уже обученную модель, и вмешательство по-прежнему эффективно блокировало целевые направления, но модель продолжала давать правильные ответы. Это означает, что модель научилась толерантности к вмешательству, изменив способ хранения или обработки информации, а не просто «обманув» метрику оценки.

Выводы

Эксперимент демонстрирует высокую степень пластичности современных LLM. Если внутренние механизмы рассуждения (J-space) заблокированы, модель способна найти альтернативные пути для выполнения задачи. Это создает риски для методов интерпретируемости и безопасности, которые полагаются на фиксированные направления активаций: модель может сохранять внешнее поведение, полностью изменив внутреннюю архитектуру вычислений.

Источник: LessWrong ↗