Исследования9 сентября 2026 г., 17:18 МСК🤖 Auto

Почему усреднение весов нейросетей дает сбой: роль перестановочной симметрии

Исследование вскрывает фундаментальную проблему метода Model Merging: перестановочная симметрия слоев делает простое усреднение весов неэффективным, требуя сложной предварительной синхронизации.

Баннер новости 7087

Проблема усреднения моделей

В эпоху открытых моделей и открытых весов метод Model Merging (слияние моделей) стал популярным инструментом для создания улучшенных архитектур без дорогостоящего дообучения. Однако стандартный подход — линейное усреднение весов (Weight Averaging) — часто приводит к деградации качества. Новая работа, опубликованная в Towards Data Science, объясняет, почему это происходит, указывая на перестановочную симметрию (permutation symmetry) как на главную причину.

Суть перестановочной симметрии

В многослойных перцептронах (MLP) и трансформерах порядок нейронов в скрытых слоях не имеет значения для выходного результата. Если переставить веса входных и выходных матриц одного слоя, функция потерь останется неизменной. Это означает, что две модели с одинаковой точностью могут иметь совершенно разные наборы весов из-за случайной перестановки нейронов в скрытых слоях.

Когда мы просто усредняем веса двух таких моделей, мы фактически складываем «несопоставимые» нейроны. Нейрон, отвечающий за распознавание определенного признака в модели A, может быть переставлен в позицию, соответствующую другому признаку в модели B. Результат — «размазывание» полезных признаков и потеря информации.

Ключевые метрики и сравнения

Исследование демонстрирует разницу между наивным усреднением и методами, учитывающими симметрию (например, через выравнивание графов или использование Sinkhorn-Knopp для оптимального сопоставления). Ниже приведена обобщенная структура сравнения подходов:

Метод Учет симметрии Точность (относительная) Вычислительная сложность
Naive Weight Averaging Нет Низкая (деградация) Низкая (O(N))
Linear Interpolation Нет Средняя Низкая (O(N))
Permutation Alignment (e.g., SOTA) Да (Sinkhorn/OT) Высокая (сохранение качества) Высокая (O(N^2) или выше)
Layer-wise Alignment Частично Хорошая Средняя

Почему это важно для разработчиков

Для инженеров ML и исследователей это означает, что:

  • Простое усреднение недопустимо для критически важных задач, если модели обучались независимо или с разными seed-значениями.
  • Необходима предварительная обработка: перед слиянием необходимо выровнять веса с помощью алгоритмов сопоставления перестановок.
  • Оптимизация ресурсов: понимание симметрии позволяет создавать более эффективные алгоритмы слияния, избегая полного перебора перестановок, который является NP-трудной задачей.

Вывод

Перестановочная симметрия — это не просто математическая особенность, а практическое препятствие для эффективного слияния моделей. Игнорирование этого факта приводит к потере производительности. Будущее Model Merging лежит в области быстрых алгоритмов выравнивания перестановок, которые смогут масштабироваться на большие модели, такие как LLMs.

Источник: Towards Data Science ↗