Проблема: компромисс между точностью и способностями
Обычные методы дообучения больших языковых моделей (LLM), такие как LoRA, часто приводят к «катастрофическому забыванию» или потере общих навыков при узкой специализации. В статье arXiv:2609.16145 автор Gautam Kishore предлагает альтернативу: CRN v2 (Correction Network v2). Это легкий модуль коррекции на уровне логитов (~34 млн обучаемых параметров), который устанавливается поверх полностью замороженной модели Gemma 4 E2B (4.65B параметров). Базовая модель не обновляется — учится только надстройка.
Методология: SFT + DPO с якорением KL
Модель обучалась на 83 400 парах «ошибка-исправление» с использованием двух этапов: Supervised Fine-Tuning (SFT) и Reference-free DPO (Direct Preference Optimization). Ключевым элементом стал член сохранения KL-дивергенции (λ=0.1), который предотвращает отклонение распределения вероятностей от базовой модели. Эксперименты показали, что снижение λ до 0.01 резко ухудшает результат до 35.0% исправлений.
Результаты: CRN v2 против LoRA
На тестовом наборе CEHRI (60 вопросов, охватывающих факты, арифметику и скрытые цели) CRN v2 демонстрирует стабильность, которую не могут повторить аналоги с меньшим объемом параметров. Ниже приведено сравнение эффективности и влияния на базовые способности.
| Метод | Параметры | Исправление ошибок (CEHRI) | Потеря способностей (MMLU/BoolQ) |
|---|---|---|---|
| CRN v2 (Logit) | ~34M (0.73%) | 53.3% | Нет деградации |
| LoRA (Baseline) | 6.6M (Rank 19) | 83.3% | 30–75% |
| Hidden-state (Layer 1) | 1.6M | 50.0% / 55.8% | Информация недостаточна |
| Shallow Injection (Layer 4) | Информация недостаточна | 30.0% / 28.3% | Информация недостаточна |
Почему это важно
Результаты подтверждают принцип: замороженное ядро + коррекция логитов + KL-якорение позволяет безопасно исправлять специфические ошибки (например, в узких доменах или при работе с фактами), не ломая общие когнитивные функции модели. CRN v2 достигает ~53% исправлений, что, по мнению автора, близко к теоретическому пределу для данного подхода, так как другие конфигурации (многослойная коррекция, удлиненное обучение) не превзошли этот результат. Все веса и код опубликованы для воспроизведения.
Источник: arXiv cs.AI ↗
