Парадокс высокой надежности метрик
Ключевая проблема, выявленная в работе, заключается в том, что статистика сжатия может быть внутренне надежной, но при этом вести к катастрофическому падению качества на конкретных группах данных. Авторы приводят конкретный пример: метрика с коэффициентом надежности сплит-половины (split-half reliability) 0.906 предсказала потенциальный выигрыш в производительности на 16.1%. Однако на практике выбранная модель оказалась на 6.0% и 7.7% хуже двух контрольных моделей.
Это демонстрирует разрыв между «оценкой потенциала» и реальным поведением модели, что критично для применения LLM в чувствительных к распределению данных сценариях.
Информационные границы и конический закон
Авторы предлагают модельровать этот разрыв через «информационные интерфейсы», которые определяют, какие различия поддерживает каждая статистика. Для групп с равными весами введен «конический закон», дающий точную цену пулинга для линейных повреждений. Исследование использует три конструкции двух миров и точный радиус волокна наблюдений, чтобы показать, что усредненные моменты (pooled moments) и локальные групповые моменты оставляют неопределенность в выборе.
Эмпирические результаты: Group-Resolved Diagonal
Вместо глобального усреднения авторы предлагают использовать Group-Resolved Diagonal. Этот метод восстанавливает общий порядок повреждений с высокой корреляцией (Spearman 0.9239), хотя тонкий порядок остается слабым. Сравнение с равномерным распределением ресурсов показывает значительное улучшение:
| Метрика / Показатель | Результат / Эффект | Примечание |
|---|---|---|
| Снижение инфляции перплексии (worst-group) | 12.6% -- 20.9% | Для трех плотных LLM при грубом распределении по глубине |
| Улучшение выбора конечной точки (endpoint) | 2.7% -- 8.0% | По сравнению с референсными моделями при полном маске |
| Предсказание направления в OLMoE | 114/192 vs 81/192 | Трассировка роутера предсказывает синглетон лучше, чем релэйблинг |
| Снижение KL-дивергенции (held-out) | 13.7% и 7.2% | Решения на основе конечного меню (finite-menu) для одного слоя |
Практическая значимость
Работа подчеркивает необходимость калибровки неопределенности для каждого сравнения. Выбор кандидатов должен лицензироваться либо полными конечными точками кандидатов, либо проверенным равномерным гарантией. Это особенно важно для архитектур с экспертами (Mixture of Experts), где трассировка роутера (router traces) в OLMoE показала способность точнее предсказывать направление, чем сильные методы переобучения (relabeling).
Источник: arXiv cs.AI ↗
