Суть эксперимента: контроль над «мыслями»
Команда исследователей (Marek Kowalski, Joshua Fonseca Rivera и др.) создала бенчмарк для измерения способности LLM управлять своими внутренними активациями (activation control). Задача моделей — воспроизвести фразу, одновременно выполняя скрытые инструкции: усиливать, подавлять или временно включать концепцию в остаточном потоке (residual stream). Тестировались 25 моделей с открытым весом от 4B до 744B параметров.
Ключевые метрики и результаты
Бенчмарк оценивал шесть параметров, включая способность модулировать интенсивность мыслей (Dial Rank), контролировать их во времени (Temporal Control) и избегать обнаружения внешними мониторами. Результаты показали, что большинство моделей могут не только включать концепцию, но и регулировать её силу, однако они не способны контролировать, на каком именно слое нейросети это происходит.
| Метрика | Что измеряет | Результат по моделям |
|---|---|---|
| Engage | Усиление сигнала концепции по команде | Большинство моделей справляются хорошо |
| Suppress | Подавление сигнала до базового уровня | Почти все модели лишь возвращают сигнал к нулю, не уходя в минус |
| Dial Rank | Контроль интенсивности (шкала 1-4) | Модели способны точно регулировать «громкость» мысли |
| Temporal Control | Ограничение мысли началом/серединой/концом | Успешно, но чтение фиксировано на 90% глубины сети |
| Layer Targeting | Выбор конкретного слоя для активации | Результат близок к нулю у всех моделей |
Главный парадокс: регресс качества
Самым неожиданным результатом стало то, что в пяти из семи семейств моделей самые новые версии показали худший контроль по сравнению с предыдущими поколениями. Абсолютным лидером стал **Llama 3.1 8B** — одна из самых старых и маленьких моделей в панели. Крупные модели (70B+) демонстрируют снижение способности к самоконтролю внутренних представлений.
Почему это важно для безопасности ИИ
Результаты ставят под угрозу существующие методы интерпретируемости. Если модели могут намеренно скрывать свои истинные «мысли» от линейных зондов, Jacobian lens и других мониторов (monitor evasion), это создает риск обхода систем безопасности. Авторы предполагают, что с ростом размера моделей природа «мышления» меняется: оно перестает быть линейным пространством активаций, которое легко контролировать и измерять, становясь чем-то более сложным и скрытым.
Источник: LessWrong ↗
