Суть эксперимента: 63.9M параметров и 4,330 источников
Автор исследовал метод Correctness-Gated Multi-Teacher Distillation (дистилляция с гейтом корректности). В фиксированном эксперименте участвовала модель-студент объемом 63.9 млн параметров, обучавшаяся на 12,990 строках оптимизации (406 обновлений). Архитектура использовала 8 «ручек» (arms), разделяющих 4,330 источников, и 7teacher-based arms с фиксированным пулом из трех ответов. Тестирование проводилось на 267 примерах с тремя разными seed-значениями.
Результаты: рост метрик, но падение качества
По сравнению с обычной (unfiltered) дистилляцией, версия с весами корректности показала статистически значимый рост точности. Однако детальный разбор выявил критические проблемы: модель перестала корректно распознавать опровергнутые факты (Refuted recall упал до 0) и в двух из трех запусков присваивала метку NotEnoughInfo всем 167 примерам с утверждениями.
| Метрика | Unfiltered Distillation | Correctness-Weighted Arm | Hard Filtering (Baseline) |
|---|---|---|---|
| Accuracy (Точность) | База | +0.1660 (95% CI [0.0670, 0.2455]) | 0.660 |
| Macro-F1 (5 меток) | База | +0.1323 (95% CI [0.0916, 0.1731]) | 0.530 |
| Unsafe Action Rate | База | -0.4979 (95% CI [-0.5926, -0.3686]) | 0.135 |
| Refuted Recall | Не указано | 0.000 (во всех семах) | Не указано |
Проблема «потерянной функциональности»
Ключевой вывод статьи: Decision Shifts, Lost Label Functionality. Модель научилась давать правильные ответы (выросла точность), но потеряла способность аргументировать их. В частности, Source-label SFT показала лучший Macro-F1 (0.586), но взвешенная модель демонстрировала потерю функциональности меток — она просто избегала сложных случаев, маркируя их как «недостаточно информации».
Аудит обоснованности (Grounding Audit) неубедителен
Авторы провели аудит на наличие доказательств (evidence-supported positives). При выборке 20 примеров:
- Weighted arm: 0/20 подтвержденных доказательством положительных ответов.
- Unfiltered arm: 1/20 подтвержденных.
- Неподтвержденный материал: 20/20 у взвешенной модели против 19/20 у обычной.
Аудит признан inconclusive (неубедительным) из-за отсутствия парных выборок и несериализованного перекрытия источников. Тем не менее, доказано, что простое Hard Filtering (отсечение по жестким правилам) уже достигало точности 0.660 и не уступало сложной дистилляции в принятии решений, не имея при этом проблем с потерей логики.
Вывод для индустрии
Исследование демонстрирует риск fixed-matrix failure: оптимизация только под метрику точности (accuracy) в multi-teacher distillation может привести к деградации способности модели к обоснованию (grounding). Внедрение гейтов корректности без контроля за функциональностью меток (label functionality) не гарантирует системного улучшения, а в некоторых случаях уступает более простым методам фильтрации.
Источник: arXiv cs.AI ↗
