Проблема «дрейфа» при обновлении знаний
Обучение мультимодальных больших языковых моделей (MLLM) на новых фактах часто приводит к катастрофическому забыванию (catastrophic forgetting). Стандартные методы, требующие полных авторитетных ответов, вызывают сдвиг в поведении модели в нерелевантных областях. Онлайн-дистилляция, использующая генерации самой модели (rollouts), смягчает эту проблему, но страдает от «грубого» контроля: она может недооценивать токены, подтвержденные справочными данными, и косвенно обучать пропущенным фактам.
Решение: RoCo-ACE
Авторы (Ян Хун, Вэй Ли и соавторы) предлагают RoCo-ACE (Rollout-Conditioned Online Distillation for Retention-Aware Knowledge Injection). Метод состоит из двух ключевых компонентов:
- RoCo (Rollout-Conditioned): Использует контрастную вероятность (likelihood contrast) между генерациями с опорой на справочные данные и без. Это перераспределяет вес дистилляции в пользу токенов, подтвержденных эталоном.
- ACE (Anchored Correction): Добавляет разреженную коррекцию для авторитетных якорей (ключевых фактов), которые модель пропустила в своей генерации, без необходимости имитировать весь полный ответ.
Результаты и метрики
Метод протестирован в трех сценариях внедрения знаний и на шести бенчмарках удержания знаний (retention benchmarks). RoCo-ACE демонстрирует наилучшую точность внедренных знаний среди сравниваемых методов, при этом показатели удержания старых знаний остаются близкими к базовой модели.
| Компонент | Функция | Решаемая проблема |
|---|---|---|
| RoCo | Контрастная вероятность | Недооценка подтвержденных токенов |
| ACE | Разреженная коррекция | Пропуск ключевых фактов (якорей) |
| Итог | Баланс | Высокая точность новых знаний + сохранение старых |
Значимость
Работа, опубликованная 10 июня 2026 года, предлагает эффективный путь к созданию самообучающихся систем, способных адаптироваться к новым данным без необходимости полного переобучения и потери ранее приобретенных компетенций.
Источник: arXiv cs.AI ↗
