Исследования4 августа 2026 г., 06:17 МСК🤖 Auto

Федеративное обучение: почему fine-tuning обманывает при оценке моделей

Исследование показывает, что стандартная проверка через дообучение (fine-tuning) на GLUE ненадежна для сравнения федеративных моделей. Прогнозирование следующего токена (next-token prediction) точнее отражает качество обучения.

Баннер новости 5011

Проблема оценки в федеративном обучении

Федеративное предобучение (Federated Pre-Training) позволяет создавать фундаментальные модели на распределенных данных без их централизации. Однако оценка таких моделей сталкивается с серьезными трудностями: различия в участии клиентов и доступности локальных данных делают прямое сравнение некорректным. Кроме того, перплексия (perplexity) на тестовом наборе во время предобучения привязана к распределению данных этого этапа, тогда как downstream-бенчмарки требуют адаптации, которая может искажать исходное качество модели.

Методология: 16M параметров и контролируемый эксперимент

Авторы работы (Claudia Grosser, Maike Heuer, Denis Krompass, Thomas A. Runkler) провели контролируемое исследование, сравнивая модели, обученные централизованно и федеративно, на идентичных данных. Использовалась трансформерная модель объемом 16 миллионов параметров. Целью было проверить, какой протокол оценки сохраняет ранжирование моделей, установленное на тестовом наборе предобучения.

Сравнивались два подхода:

  • Downstream fine-tuning: дообучение на бенчмарке GLUE (полное, только заголовки, с уменьшенным объемом данных).
  • Intrinsic evaluation: прямое прогнозирование следующего токена (next-token prediction) на текстах из GLUE.

Ключевые результаты: Fine-tuning вводит в заблуждение

Результаты эксперимента показали критическое расхождение между методами оценки. Дообучение на downstream-задачах не сохраняет надежное ранжирование моделей, полученное на этапе предобучения. Это означает, что модель, показавшая лучший результат после fine-tuning, не обязательно была лучшей в процессе самого предобучения.

Метод оценки Связь с качеством предобучения Надежность ранжирования
Downstream Fine-tuning (GLUE) Слабая / Отсутствует Ненадежная (вводит в заблуждение)
Next-token prediction (Intrinsic) Сильная корреляция Высокая (сохраняет референсное ранжирование)

Вывод для индустрии

Исследование ставит под сомнение использование исключительно downstream-задач для сравнения федеративных моделей. Авторы рекомендуют уделять больше внимания сигналам оценки, близким к исходной цели предобучения (таким как next-token prediction), так как они достовернее отражают внутреннее качество модели и позволяют избежать ложных выводов о превосходстве одного подхода над другим.

Источник: arXiv cs.CL ↗