Исследования7 сентября 2026 г., 10:18 МСК🤖 Auto

Квантование ломает память RNN: как 4-битное хранение сбивает точность

Исследование показывает, что простое квантование состояний рекуррентных сетей (GRU/LSTM) до 4 бит увеличивает ошибку в 70–300 раз. Авторы предлагают метод «записи состояния» с коррекцией ошибок, позволяющий восстановить точность без переобучения.

Баннер новости 6917

Проблема: «Замороженное» состояние при низком бите

Квантование широко используется для ускорения инференса нейросетей, но в рекуррентных архитектурах (RNN, GRU, LSTM) возникает критическая проблема: правило, по которому квантованное состояние записывается обратно в память для следующего временного шага, может кардинально изменить вычисления. Авторы исследования (Ismail Erbas, Xavier Intes, Vikas Pandey) изолировали этот эффект, назвав его recurrent-state write-back (запись рекуррентного состояния).

Эксперименты проводились на компактном кодеке GRU для задач флуоресцентной микроскопии, где необходимо оценивать два параметра времени жизни: короткоживущий ($\tau_1$) и долгоживущий ($\tau_2$). При фиксированной обученной модели замена непрерывного распространения состояния на детерминированное хранение в 4-битном формате привела к катастрофическому росту ошибок.

Цифры и метрики

Ключевой вывод статьи: при использовании 4-битного хранения состояния ошибки оценки параметров возрастают экспоненциально. Это происходит из-за того, что повторяющиеся малые обновления остаются ниже порога квантования, «замораживая» состояние, в то время как сеть продолжает предлагать изменения.

Параметр Тип измерения Рост ошибки при 4-bit write-back
$\tau_1$ (короткоживущий компонент) Относительная ошибка ~70x
$\tau_2$ (долгоживущий компонент) Относительная ошибка ~300x

Решение: Error Feedback и Residual Memory

Авторы продемонстрировали, что точность можно восстановить без переобучения модели, используя специальные механизмы передачи информации о подавленных обновлениях:

  • Error Feedback (Обратная связь по ошибке): сохранение разницы между ожидаемым и фактическим значением состояния.
  • Residual Memory (Остаточная память): накопление мелких изменений, которые не помещаются в квантованный формат.
  • Direction Memory (Память направления): хранение информации о направлении градиента обновления.

Эти методы позволяют «протаскивать» информацию через временные шаги, компенсируя потерю точности из-за квантования.

Обобщение на LSTM и парадокс точности

Эксперименты были повторены на независимо обученной сети LSTM. Результаты подтвердили: грубая запись состояния воспроизводит сбой, а error feedback восстанавливает точность. При этом выявлена большая чувствительность cell state (состояния ячейки) по сравнению с hidden state (скрытым состоянием).

Интересный парадокс: увеличение точности хранения состояния (precision sweeps) в уже обученной модели может даже ухудшить результаты фиксированного рекуррентного решения. Однако matched training (согласованное обучение), при котором сеть учится совместимости с интерфейсом хранения состояния, позволяет достичь высокой точности даже при низком бите.

Вывод для индустрии

Исследование устанавливает recurrent-state write-back как ключевой детерминант динамики RNN при низком бите. Интерфейс хранения состояния становится центральным элементом проектирования для квантованного инференса. Игнорирование этого аспекта делает квантование RNN-моделей неэффективным или вовсе нерабочим без применения специализированных методов коррекции ошибок.

Источник: arXiv cs.AI ↗