Исследования12 сентября 2026 г., 02:17 МСК🤖 Auto

Провал Correctness-Gated Distillation: метрики растут, но модель теряет логику

Исследование Xiaofei Feng (arXiv:2609.09702) показывает, что взвешенная дистилляция от нескольких учителей повышает точность, но приводит к потере функциональности меток и не гарантирует обоснованность ответов.

Баннер новости 7316

Суть эксперимента: 63.9M параметров и 4,330 источников

Автор исследовал метод Correctness-Gated Multi-Teacher Distillation (дистилляция с гейтом корректности). В фиксированном эксперименте участвовала модель-студент объемом 63.9 млн параметров, обучавшаяся на 12,990 строках оптимизации (406 обновлений). Архитектура использовала 8 «ручек» (arms), разделяющих 4,330 источников, и 7teacher-based arms с фиксированным пулом из трех ответов. Тестирование проводилось на 267 примерах с тремя разными seed-значениями.

Результаты: рост метрик, но падение качества

По сравнению с обычной (unfiltered) дистилляцией, версия с весами корректности показала статистически значимый рост точности. Однако детальный разбор выявил критические проблемы: модель перестала корректно распознавать опровергнутые факты (Refuted recall упал до 0) и в двух из трех запусков присваивала метку NotEnoughInfo всем 167 примерам с утверждениями.

Метрика Unfiltered Distillation Correctness-Weighted Arm Hard Filtering (Baseline)
Accuracy (Точность) База +0.1660 (95% CI [0.0670, 0.2455]) 0.660
Macro-F1 (5 меток) База +0.1323 (95% CI [0.0916, 0.1731]) 0.530
Unsafe Action Rate База -0.4979 (95% CI [-0.5926, -0.3686]) 0.135
Refuted Recall Не указано 0.000 (во всех семах) Не указано

Проблема «потерянной функциональности»

Ключевой вывод статьи: Decision Shifts, Lost Label Functionality. Модель научилась давать правильные ответы (выросла точность), но потеряла способность аргументировать их. В частности, Source-label SFT показала лучший Macro-F1 (0.586), но взвешенная модель демонстрировала потерю функциональности меток — она просто избегала сложных случаев, маркируя их как «недостаточно информации».

Аудит обоснованности (Grounding Audit) неубедителен

Авторы провели аудит на наличие доказательств (evidence-supported positives). При выборке 20 примеров:

  • Weighted arm: 0/20 подтвержденных доказательством положительных ответов.
  • Unfiltered arm: 1/20 подтвержденных.
  • Неподтвержденный материал: 20/20 у взвешенной модели против 19/20 у обычной.

Аудит признан inconclusive (неубедительным) из-за отсутствия парных выборок и несериализованного перекрытия источников. Тем не менее, доказано, что простое Hard Filtering (отсечение по жестким правилам) уже достигало точности 0.660 и не уступало сложной дистилляции в принятии решений, не имея при этом проблем с потерей логики.

Вывод для индустрии

Исследование демонстрирует риск fixed-matrix failure: оптимизация только под метрику точности (accuracy) в multi-teacher distillation может привести к деградации способности модели к обоснованию (grounding). Внедрение гейтов корректности без контроля за функциональностью меток (label functionality) не гарантирует системного улучшения, а в некоторых случаях уступает более простым методам фильтрации.

Источник: arXiv cs.AI ↗