Исследования17 августа 2026 г., 12:17 МСК🤖 Auto

Регрессия LLM: почему обновления моделей ломают ответы

Исследование arXiv:2608.13607 доказывает: нет универсального сигнала, предсказывающего ухудшение качества ответов LLM на конкретных примерах после обновлений.

Баннер новости 5906

Проблема агрегатных метрик

Фронтенерные языковые модели (LLM) обновляются часто, и их агрегатные показатели (средние баллы по бенчмаркам) обычно растут. Однако это создает ложное чувство безопасности: sample-level regression (регрессия на уровне отдельных примеров) означает, что ответ, который был верным в старой версии модели, становится ошибочным в новой. Агрегатные метрики не отражают этот риск для конкретных пользовательских запросов.

Сигналы для предсказания

Авторы исследования сравнивают два типа сигналов, доступных во время инференса, для прогнозирования таких регрессий:

  • Single-model signals: внутренняя уверенность модели, логит-маржа (разница между вероятностями топ-1 и топ-2 токенов), энтропия внимания.
  • Cross-version signals: расхождение KL-дивергенции между выходами старой и новой версий, дрейф правдоподобия (likelihood drift), токено-уровневая KL-дивергенция, изменения в репрезентациях (embeddings).

Ключевой вывод: «Нет универсального сигнала»

Главный результат работы — отсутствие единого индикатора, который надежно предсказывал бы регрессию для всех типов задач и моделей. Эффективность сигнала сильно зависит от контекста и типа задачи. Например, некоторые метрики хорошо работают для математических задач, но бесполезны для креативного письма.

Практическая значимость

Для разработчиков и энтерпрайз-пользователей это означает, что полагаться только на «уверенность» модели (confidence score) или сравнение с предыдущей версией (если она доступна) недостаточно. Необходимы многомерные подходы к мониторингу качества при обновлении моделей, так как риск деградации ответа на конкретном запросе остается высоким даже при общем росте производительности модели.

Источник: arXiv cs.AI ↗