Исследования16 сентября 2026 г., 07:19 МСК🤖 Auto

CRN v2: Как исправить LLM без потери интеллекта

Исследователь Gautam Kishore представил CRN v2 — модуль коррекции для замороженных LLM, исправляющий 53.3% ошибок Gemma 4.65B без деградации базовых способностей.

Баннер новости 7599

Проблема: компромисс между точностью и способностями

Обычные методы дообучения больших языковых моделей (LLM), такие как LoRA, часто приводят к «катастрофическому забыванию» или потере общих навыков при узкой специализации. В статье arXiv:2609.16145 автор Gautam Kishore предлагает альтернативу: CRN v2 (Correction Network v2). Это легкий модуль коррекции на уровне логитов (~34 млн обучаемых параметров), который устанавливается поверх полностью замороженной модели Gemma 4 E2B (4.65B параметров). Базовая модель не обновляется — учится только надстройка.

Методология: SFT + DPO с якорением KL

Модель обучалась на 83 400 парах «ошибка-исправление» с использованием двух этапов: Supervised Fine-Tuning (SFT) и Reference-free DPO (Direct Preference Optimization). Ключевым элементом стал член сохранения KL-дивергенции (λ=0.1), который предотвращает отклонение распределения вероятностей от базовой модели. Эксперименты показали, что снижение λ до 0.01 резко ухудшает результат до 35.0% исправлений.

Результаты: CRN v2 против LoRA

На тестовом наборе CEHRI (60 вопросов, охватывающих факты, арифметику и скрытые цели) CRN v2 демонстрирует стабильность, которую не могут повторить аналоги с меньшим объемом параметров. Ниже приведено сравнение эффективности и влияния на базовые способности.

Метод Параметры Исправление ошибок (CEHRI) Потеря способностей (MMLU/BoolQ)
CRN v2 (Logit) ~34M (0.73%) 53.3% Нет деградации
LoRA (Baseline) 6.6M (Rank 19) 83.3% 30–75%
Hidden-state (Layer 1) 1.6M 50.0% / 55.8% Информация недостаточна
Shallow Injection (Layer 4) Информация недостаточна 30.0% / 28.3% Информация недостаточна

Почему это важно

Результаты подтверждают принцип: замороженное ядро + коррекция логитов + KL-якорение позволяет безопасно исправлять специфические ошибки (например, в узких доменах или при работе с фактами), не ломая общие когнитивные функции модели. CRN v2 достигает ~53% исправлений, что, по мнению автора, близко к теоретическому пределу для данного подхода, так как другие конфигурации (многослойная коррекция, удлиненное обучение) не превзошли этот результат. Все веса и код опубликованы для воспроизведения.

Источник: arXiv cs.AI ↗