Исследования1 октября 2026 г., 07:17 МСК🤖 Auto

GAD-RL: Новый метод OCR-верификации для Qwen3.5-2B

Исследователи представили GAD-RL — метод адаптивного обучения с подкреплением, который устраняет проблему «галлюцинаций» OCR в VLM, повышая точность транскрипции на CHAOS-Bench до 59.92%.

Баннер новости 8663

Проблема: VLM исправляют ошибки, а не читают

Визуально-языковые модели (VLM) часто склонны к «лингвистической коррекции»: если на изображении опечатка или нестандартное написание, модель может заменить его на грамматически верное слово. Это критически снижает верность (faithfulness) распознавания текста. Традиционные методы дистилляции от фиксированного учителя становятся менее эффективными по мере улучшения ученика, так как статичные подсказки перестают соответствовать растущим возможностям модели.

Решение: GAD-RL (Gated and Attenuated On-Policy Distillation)

Авторы (Baode Wang, Zuming Huang и др.) предложили GAD-RL — механизм, который динамически регулирует влияние учителя в процессе совместного пост-обучения. Ключевые особенности:

  • Гейтирование (Gating): Дистилляция полностью отключается для групп ответов, где задача выполнена с наградой (reward) ≥ 0.95. Это предотвращает «размытие» уже хороших результатов.
  • Атенюация (Attenuation): Сила влияния учителя плавно снижается по мере роста средней награды группы. Учитель не навязывает свои ошибки, когда ученик уже справляется лучше.
  • Взвешивание KL-дивергенции: Forward KL-дивергенция взвешивается по вероятности токена учителя (Top-1) в модели ученика. Если ученик мало уверен в предложении учителя, локальные вспомогательные обновления смягчаются.

Результаты: Превосходство над GRPO

Метод протестирован на модели Qwen3.5-2B. GAD-RL демонстрирует статистически значимое улучшение метрик верности распознавания по сравнению с базовыми методами RL (GRPO) и их модификациями с фиксированным весом (GRPO+OPD).

Метрика / Датасет GRPO GRPO+OPD (Fixed) GAD-RL (Ours)
Micro Recall (CHAOS-Bench) 51.47% 55.49% 59.92%
Overall Score (OmniDocBench v1.6) — — 91.18
Прирост над GRPO (CHAOS) — +4.02 п.п. +8.45 п.п.

Почему это важно

GAD-RL решает фундаментальную проблему баланса между «следованием за учителем» и «собственной инициативой» модели. Для индустрии OCR это означает возможность использовать более легкие модели (вроде 2B параметров) для задач, требующих высокой точности транскрипции документов, без необходимости использования тяжелых энкодеров. Метод опубликован 29 сентября 2026 года в arXiv (cs.AI).

Источник: arXiv cs.AI ↗