Проблема оценки в федеративном обучении
Федеративное предобучение (Federated Pre-Training) позволяет создавать фундаментальные модели на распределенных данных без их централизации. Однако оценка таких моделей сталкивается с серьезными трудностями: различия в участии клиентов и доступности локальных данных делают прямое сравнение некорректным. Кроме того, перплексия (perplexity) на тестовом наборе во время предобучения привязана к распределению данных этого этапа, тогда как downstream-бенчмарки требуют адаптации, которая может искажать исходное качество модели.
Методология: 16M параметров и контролируемый эксперимент
Авторы работы (Claudia Grosser, Maike Heuer, Denis Krompass, Thomas A. Runkler) провели контролируемое исследование, сравнивая модели, обученные централизованно и федеративно, на идентичных данных. Использовалась трансформерная модель объемом 16 миллионов параметров. Целью было проверить, какой протокол оценки сохраняет ранжирование моделей, установленное на тестовом наборе предобучения.
Сравнивались два подхода:
- Downstream fine-tuning: дообучение на бенчмарке GLUE (полное, только заголовки, с уменьшенным объемом данных).
- Intrinsic evaluation: прямое прогнозирование следующего токена (next-token prediction) на текстах из GLUE.
Ключевые результаты: Fine-tuning вводит в заблуждение
Результаты эксперимента показали критическое расхождение между методами оценки. Дообучение на downstream-задачах не сохраняет надежное ранжирование моделей, полученное на этапе предобучения. Это означает, что модель, показавшая лучший результат после fine-tuning, не обязательно была лучшей в процессе самого предобучения.
| Метод оценки | Связь с качеством предобучения | Надежность ранжирования |
|---|---|---|
| Downstream Fine-tuning (GLUE) | Слабая / Отсутствует | Ненадежная (вводит в заблуждение) |
| Next-token prediction (Intrinsic) | Сильная корреляция | Высокая (сохраняет референсное ранжирование) |
Вывод для индустрии
Исследование ставит под сомнение использование исключительно downstream-задач для сравнения федеративных моделей. Авторы рекомендуют уделять больше внимания сигналам оценки, близким к исходной цели предобучения (таким как next-token prediction), так как они достовернее отражают внутреннее качество модели и позволяют избежать ложных выводов о превосходстве одного подхода над другим.
Источник: arXiv cs.CL ↗
