Суть прорыва: от 20B к 4.2B
На конференции WMT26 команда ESTS (в составе Liu O. Martin, Lucas Bandarkar, Nanyun Peng) представила шесть вариантов сжатия моделей машинного перевода. Базовой архитектурой выступила модель GPT-OSS-20B. Авторы применили метод Routing-Informed Expert Pruning, который позволяет физически удалять наименее важные «эксперты» (нейронные модули) в MoE-архитектуре, опираясь на данные о маршрутизации запросов.
Ключевая инновация заключается в двухэтапном отборе: сначала ранжирование экспертов на основе специфичной для задачи массы маршрутизации, затем распределение сохраняемой емкости по слоям с учетом кросс-лингвистического расхождения маршрутизации. После физического удаления «мусорных» весов модель проходит recovery-tuning на синтетических данных, сгенерированных GPT-5.1.
Технические детали и метрики
Метод включает не только pruning, но и агрессивное квантование: проекционные веса оставшихся экспертов были сжаты до формата MXFP4. Это позволило достичь экстремального сжатия артефактов при сохранении лингвистической точности. Команда протестировала модель на двух направлениях: Английский — Упрощенный китайский и Английский — Египетский арабский.
| Параметр | Значение / Диапазон |
|---|---|
| Базовая модель | GPT-OSS-20B |
| Диапазон параметров (после сжатия) | 4.186B – 7.770B |
| Размер упакованного артефакта | 4.55 – 6.33 GiB |
| Метод квантования весов | MXFP4 |
| Источник данных для дообучения | Синтетические данные GPT-5.1 |
| Внутренняя оценка качества | xCOMET-XL (с псевдо-референсами GPT-5.1) |
Инфраструктура и надежность
Помимо самой модели, команда разработала robust inference system для условий WMT26. Система включает категоризацию инструкций, валидацию вывода, механизмы повторных попыток (retries), сегментированный фоллбэк и реконструкцию JSON, принадлежащего источнику. Это критически важно для промышленного внедрения, где стабильность вывода часто важнее абсолютного максимума BLEU.
Почему это важно
Результаты ESTS демонстрируют, что MoE-модели можно сжимать в 4-5 раз, не прибегая к полному переобучению с нуля. Использование routing mass как метрики важности эксперта оказывается эффективнее случайного или статистического отсечения. Сжатие до ~4.5 GiB делает такие модели потенциально пригодными для развертывания на edge-устройствах или в условиях ограниченных вычислительных ресурсов, сохраняя при этом конкурентоспособность с более крупными dense-моделями.
Источник: arXiv cs.CL ↗
