Суть эксперимента: «поражение» как инструмент обучения
Исследователь Devin Shah провел серию экспериментов на модели Qwen3.5-4B, чтобы проверить гипотезу функциональной компенсации. Используя методологию J-lens (Jacobian lens), он идентифицировал направления в активациях модели, связанные с вербализуемыми представлениями и внутренним рассуждением. В процессе обучения (SFT) эти направления в слоях с 16 по 22 постоянно подавлялись — это имитировало «поражение» нейронных цепей, аналогичное удалению частей мозга у людей.
Задача модели заключалась в многошаговом географическом выводе (город → страна → столица/валюта), где промежуточные шаги не должны были выводиться явно. Изначально, без обучения, «пораженная» модель справлялась лишь с 20,9% (27 из 129) примеров.
Результаты: от хаоса к точности
После обучения с активным вмешательством точность модели на тестовой выборке (страны, не участвовавшие в обучении) выросла до 97,7% (126 из 129). Это доказывает, что модель не просто запоминает ответы, а перестраивает свои внутренние вычислительные контуры, чтобы обойти заблокированные пути.
| Условие обучения | Точность с вмешательством (J-lesion) | Точность в чистом виде (Clean) |
|---|---|---|
| Базовая модель (без обучения) | 20,9% (27/129) | 100% (129/129) |
| Основной эксперимент (SFT с J-lesion) | 97,7% (126/129) | 98,4% (127/129) |
| Второй запуск (другой seed) | 92,2% (119/129) | 100% (129/129) |
| Контроль: случайные возмущения | 58,1% (75/129) | 97,7% (126/129) |
| Контроль: обычное SFT (без lesion) | 65,9% (85/129) | 97,7% (126/129) |
Почему это важно для безопасности AI
Ключевой вывод заключается в том, что восстановление поведения не является артефактом изменения самой модели J-lens. Исследователь «перенастроил» линзу на уже обученную модель, и вмешательство по-прежнему эффективно блокировало целевые направления, но модель продолжала давать правильные ответы. Это означает, что модель научилась толерантности к вмешательству, изменив способ хранения или обработки информации, а не просто «обманув» метрику оценки.
Выводы
Эксперимент демонстрирует высокую степень пластичности современных LLM. Если внутренние механизмы рассуждения (J-space) заблокированы, модель способна найти альтернативные пути для выполнения задачи. Это создает риски для методов интерпретируемости и безопасности, которые полагаются на фиксированные направления активаций: модель может сохранять внешнее поведение, полностью изменив внутреннюю архитектуру вычислений.
Источник: LessWrong ↗