Проблема агрегированных метрик
Сжатие больших языковых моделей (LLM) необходимо для снижения затрат на развертывание, однако стандартные показатели, такие как перплексия (perplexity) и общая точность, часто маскируют критические сдвиги в поведении модели. Исследование авторов Yuan Wu, Mairui Li, Lesia Semenova и Chudi Zhong демонстрирует, что усредненные цифры создают иллюзию стабильности, скрывая глубокие структурные изменения в знаниях и уверенности модели.
Асимметрия знаний: «Голова» против «Хвоста»
Авторы провели систематическую оценку 3 базовых LLM с использованием 11 различных методов сжатия. Ключевым открытием стала асимметрия в сохранении знаний: сжатие непропорционально сильно бьет по так называемым «head» знаниям (высокочастотным, общим фактам) по сравнению с «tail» знаниями (редкими, узкоспециализированными). При этом модель может терять способность отвечать на сложные запросы, оставаясь при этом статистически «уверенной» в своих ответах.
Ложная уверенность в ошибках
Опасный побочный эффект сжатия — сохранение высокой уверенности модели в неверных ответах на темы, которые она фактически «забыла». Это создает риск использования сжатых моделей в критических сценариях, где модель будет уверенно генерировать галлюцинации, не подавая сигналов о неуверенности.
Скрытая предвзятость (Bias)
Исследование также выявило, что стабильные агрегированные оценки предвзятости (bias scores) могут скрывать существенные, противоположно направленные сдвиги стереотипных предпочтений среди различных демографических подгрупп. То есть общая картина «безопасности» модели может оставаться неизменной, в то время как для конкретных групп пользователей качество и этичность ответов резко ухудшаются.
Выводы для индустрии
Результаты подчеркивают необходимость гранулярной (подробной) оценки сжатых моделей перед их внедрением. Полагаться только на агрегированные метрики недопустимо, так как они не способны отразить асимметричные поведенческие изменения, которые могут привести к серьезным ошибкам и этическим проблемам.
Источник: arXiv cs.CL ↗
