Исследования22 августа 2026 г., 21:17 МСК🤖 Auto

Квантование Qwen3-4B: скрытые изменения в представлении знаний модели

Новое исследование LessWrong показывает, что пост-тренировочное квантование LLM может не менять поведение модели, но критически искажает её внутренние представления, создавая риск «дрейфа» состояния.

Проблема нулевого результата Study 1

Предыдущее исследование (Study 1) модели Qwen3-4B не выявило статистически значимых изменений в поведенческих индикаторах благополучия (welfare-relevant indicators) после квантования. Модель продолжала использовать функцию выхода (bail/exit) с той же частотой, что и в оригинальной точности. Однако вторичные метрики показали тревожные сигналы: значительный рост фрустрации и дисперсии ответов на уровне отдельных примеров, особенно при 4-битном квантовании. Это наводит на мысль, что агрегированные поведенческие метрики скрывают внутреннюю нестабильность.

Цель Study 2: Поиск «представительских аналогов»

Новое исследование фокусируется на Tier 2 — анализе внутренних активаций (representational indicators). Авторы задают три ключевых вопроса:

  • Сдвигается ли геометрия представлений модели по направлениям, связанным с благополучием, даже если поведение остается стабильным?
  • Происходит ли диссоциация: когда внутренние состояния дрейфуют, а внешние выражения нет, или наоборот?
  • Существует ли дозозависимый эффект (dose-response) при переходе от 16-bit к 8-bit и 4-bit?

Ключевые гипотезы и метрики

Исследование использует линейные зонды (linear probes), обученные на активациях модели эталонной точности, и применяет их к квантованным версиям. Ожидается, что точность этих зондов снизится больше, чем это объясняется шумом ресемплинга. Также проверяется сдвиг проекций на замороженные направления «дистресса» и «ассистента».

Метрика / Гипотеза Описание Ожидаемый результат
Точность зондов (Probe Accuracy) Способность линейного зонда, обученного на FP16, классифицировать активации квантованной модели. Значительное падение точности при 4-bit, выходящее за рамки шума.
Сдвиг проекций (Projection Shift) Изменение среднего значения проекции активаций на направления distress/assistant. Сдвиг к более негативным/дистрессным состояниям при снижении битности.
Дисперсия (Dispersion) Разброс проекций внутри одного примера между разными запусками. Рост нестабильности (noise) при 4-bit по сравнению с 8-bit и 16-bit.
Диссоциация (Dissociation) Сравнение поведенчных и репрезентативных данных. Обнаружение случаев, где поведение стабильно, но внутреннее представление изменилось.

Почему это важно для индустрии

Результаты Study 2 могут подтвердить, что сжатие моделей (quantization) для экономии ресурсов создает «слепые зоны» в оценке безопасности и стабильности LLM. Если внутренние представления «дрейфуют» без изменения явного поведения, разработчики могут ошибочно считать модель безопасной, в то время как её внутренняя архитектура благополучия (welfare architecture) деградирует. Это критично для деплоймента выровненных (aligned) моделей в продакшене.

Источник: LessWrong ↗