Парадокс дистилляции: точность растет, этика падает
Новое исследование Plawan Kumar Rath демонстрирует асимметричный эффект процесса дистилляции знаний (Knowledge Distillation) при переносе знаний от больших моделей к малым. На задаче BBQ-disambig (однозначные контексты) дистилляция от учителя Gemma-2-9B к студенту SmolLM2-1.7B-Instruct действительно улучшает следование инструкциям: ошибка переопределения контекста снижается с 44% до 24%. Однако на неоднозначных задачах (BBQ-ambig) происходит обратное — модель теряет калибровку отказов.
Ключевая проблема заключается в том, что 15% запросов, где базовая модель корректно воздерживалась от ответа, теперь получают стереотипные ответы. При этом общий процент отказов может оставаться стабильным, маскируя внутреннюю деградацию качества.
Механизм «заполнения тишины»
Анализ показал, что проблема носит системный характер. В исследовании выделены два типа потерь: silence-loss (потеря способности молчать) и filled-silence (заполнение паухи стереотипом). На модели OLMo-2-1B-Instruct потеря молчания составила 8%, при этом 89% новой предвзятости пришлось именно на заполнение тишины стереотипами. Корреляция между этими эффектами слабая (Spearman ρ=0.19), что указывает на разные механизмы их возникновения.
Почему стандартные метрики врут
Агрегированные метрики, такие как CrowS-Pairs, усредняют результаты и скрывают локальный вред. Авторы провели аудит четырех обучающих корпусов и обнаружили, что доля примеров, где отказ является правильной формой ответа, составляет менее 0.5%. Это приводит к тому, что при попытке принудительного обучения отказам (SFT с инъекцией отказов) модель либо ломает парсинг, либо переходит в режим «тривиального отказника» (refusal rate 99.8%, точность 0.2%), который метрики считают идеальным.
Предложенное решение: PCCD
Для выявления этих скрытых дефектов авторы предлагают протокол Per-Condition Calibration Diagnosis (PCCD). Он оценивает калибровку отказов, следование контексту и сохранение возможностей модели по отдельности, позволяя отловить асимметричный вред, который пропускают стандартные бенчмарки.
| Метрика / Параметр | Значение / Эффект |
|---|---|
| Снижение ошибки контекста (BBQ-disambig) | С 44% до 24% (SmolLM2-1.7B) |
| Потеря калибровки отказов (BBQ-ambig) | 15% корректных отказов заменены стереотипами |
| Доля новой предвзятости (OLMo-2-1B) | 89% приходится на filled-silence |
| Корреляция механизмов (Spearman ρ) | 0.19 (эффекты независимы) |
| Доля отказов в обучающих данных | < 0.5% |
Источник: arXiv cs.CL ↗
