Проблема нулевого результата Study 1
Предыдущее исследование (Study 1) модели Qwen3-4B не выявило статистически значимых изменений в поведенческих индикаторах благополучия (welfare-relevant indicators) после квантования. Модель продолжала использовать функцию выхода (bail/exit) с той же частотой, что и в оригинальной точности. Однако вторичные метрики показали тревожные сигналы: значительный рост фрустрации и дисперсии ответов на уровне отдельных примеров, особенно при 4-битном квантовании. Это наводит на мысль, что агрегированные поведенческие метрики скрывают внутреннюю нестабильность.
Цель Study 2: Поиск «представительских аналогов»
Новое исследование фокусируется на Tier 2 — анализе внутренних активаций (representational indicators). Авторы задают три ключевых вопроса:
- Сдвигается ли геометрия представлений модели по направлениям, связанным с благополучием, даже если поведение остается стабильным?
- Происходит ли диссоциация: когда внутренние состояния дрейфуют, а внешние выражения нет, или наоборот?
- Существует ли дозозависимый эффект (dose-response) при переходе от 16-bit к 8-bit и 4-bit?
Ключевые гипотезы и метрики
Исследование использует линейные зонды (linear probes), обученные на активациях модели эталонной точности, и применяет их к квантованным версиям. Ожидается, что точность этих зондов снизится больше, чем это объясняется шумом ресемплинга. Также проверяется сдвиг проекций на замороженные направления «дистресса» и «ассистента».
| Метрика / Гипотеза | Описание | Ожидаемый результат |
|---|---|---|
| Точность зондов (Probe Accuracy) | Способность линейного зонда, обученного на FP16, классифицировать активации квантованной модели. | Значительное падение точности при 4-bit, выходящее за рамки шума. |
| Сдвиг проекций (Projection Shift) | Изменение среднего значения проекции активаций на направления distress/assistant. | Сдвиг к более негативным/дистрессным состояниям при снижении битности. |
| Дисперсия (Dispersion) | Разброс проекций внутри одного примера между разными запусками. | Рост нестабильности (noise) при 4-bit по сравнению с 8-bit и 16-bit. |
| Диссоциация (Dissociation) | Сравнение поведенчных и репрезентативных данных. | Обнаружение случаев, где поведение стабильно, но внутреннее представление изменилось. |
Почему это важно для индустрии
Результаты Study 2 могут подтвердить, что сжатие моделей (quantization) для экономии ресурсов создает «слепые зоны» в оценке безопасности и стабильности LLM. Если внутренние представления «дрейфуют» без изменения явного поведения, разработчики могут ошибочно считать модель безопасной, в то время как её внутренняя архитектура благополучия (welfare architecture) деградирует. Это критично для деплоймента выровненных (aligned) моделей в продакшене.
Источник: LessWrong ↗