Проблема агрегатных метрик
Фронтенерные языковые модели (LLM) обновляются часто, и их агрегатные показатели (средние баллы по бенчмаркам) обычно растут. Однако это создает ложное чувство безопасности: sample-level regression (регрессия на уровне отдельных примеров) означает, что ответ, который был верным в старой версии модели, становится ошибочным в новой. Агрегатные метрики не отражают этот риск для конкретных пользовательских запросов.
Сигналы для предсказания
Авторы исследования сравнивают два типа сигналов, доступных во время инференса, для прогнозирования таких регрессий:
- Single-model signals: внутренняя уверенность модели, логит-маржа (разница между вероятностями топ-1 и топ-2 токенов), энтропия внимания.
- Cross-version signals: расхождение KL-дивергенции между выходами старой и новой версий, дрейф правдоподобия (likelihood drift), токено-уровневая KL-дивергенция, изменения в репрезентациях (embeddings).
Ключевой вывод: «Нет универсального сигнала»
Главный результат работы — отсутствие единого индикатора, который надежно предсказывал бы регрессию для всех типов задач и моделей. Эффективность сигнала сильно зависит от контекста и типа задачи. Например, некоторые метрики хорошо работают для математических задач, но бесполезны для креативного письма.
Практическая значимость
Для разработчиков и энтерпрайз-пользователей это означает, что полагаться только на «уверенность» модели (confidence score) или сравнение с предыдущей версией (если она доступна) недостаточно. Необходимы многомерные подходы к мониторингу качества при обновлении моделей, так как риск деградации ответа на конкретном запросе остается высоким даже при общем росте производительности модели.
Источник: arXiv cs.AI ↗
