Исследования15 сентября 2026 г., 17:23 МСК🤖 Auto

FLoKD: Экономия 65% трафика при обучении LLM в федеративных сетях

Исследователи представили FLoKD — метод адаптивного дистилляции знаний для LoRA-моделирования в беспроводных сетях, снижающий объем передаваемых данных без потери точности.

Баннер новости 7545

Проблема: «Удушье» трафика при федеративном обучении LLM

Обучение больших языковых моделей (LLM) в условиях федеративного обучения (FL) сталкивается с критическим узким местом: необходимостью передачи весов моделей через каналы с ограниченной пропускной способностью. Хотя адаптация низкого ранга (LoRA) сокращает количество обучаемых параметров, стоимость передачи все равно растет вместе с масштабом модели. Альтернатива — дистилляция знаний через логиты (output logits) — также неэффективна: из-за огромного размера словаря и длины последовательности передача токенов создает колоссальную нагрузку на сеть, а упрощение логитов ведет к падению точности модели.

Решение: FLoKD и промежуточные активации

Команда авторов во главе с Синлу Чжаном (Xinlu Zhang) предложила архитектуру FLoKD (Federated Low-Rank Knowledge Distillation). Ключевая инновация заключается в том, что вместо передачи полных параметров или логитов, клиенты передают промежуточные активации LoRA в качестве сигнала дистилляции. Это позволяет учителю (серверу) обучать модель, используя более информативные градиенты, чем просто выходные вероятности, но с меньшим объемом данных, чем полные веса.

Механизм оптимизации: Оценка важности блоков

Для дальнейшего снижения нагрузки FLoKD внедряет систему оценки важности блоков трансформера. Алгоритм выбирает только наиболее информативные блоки для передачи. Дополнительно применяются две стратегии отбора данных:

  • Отбрасывание публичных образцов, сильно отклоняющихся от локального распределения данных клиента.
  • Приоритизация тех образцов, которые максимально полезны для дистилляции.

Результаты: Скорость и эффективность

Эксперименты проводились на наборах данных WikiText-103, PTB и Dialog. Метод демонстрирует быструю сходимость к конкурентоспособному перплексити (perplexity), значительно превосходя базовые подходы по эффективности использования канала связи.

Метрика / Параметр Результат FLoKD Значение для индустрии
Снижение коммуникационных затрат 50–65% Возможность обучения LLM на мобильных устройствах и в сетях 5G/6G без перегрузки каналов.
Качество модели (Perplexity) Конкурентоспособное Точность не жертвуется ради экономии трафика; модель сохраняет способность к генерации.
Скорость сходимости Быстрая Меньше итераций для достижения целевой точности, что экономит энергию устройств.

Почему это важно

FLoKD закрывает один из главных барьеров на пути к децентрализованному ИИ: невозможность эффективно обновлять тяжелые модели в условиях нестабильного или дорогого соединения. Это открывает путь к созданию приватных, распределенных LLM, которые могут обучаться на данных миллионов пользователей без отправки сырых данных на сервер и без необходимости в сверхбыстром интернет-соединении.

Источник: arXiv cs.AI ↗