Исследования14 сентября 2026 г., 11:17 МСК🤖 Auto

ESTS: Сжатие GPT-OSS-20B до 4.2B без потери качества через pruning

Команда ESTS представила метод сжатия LLM для WMT26, сократив модель GPT-OSS-20B до 4.2B параметров с помощью маршрутизации экспертов и квантования MXFP4.

Баннер новости 7433

Суть прорыва: от 20B к 4.2B

На конференции WMT26 команда ESTS (в составе Liu O. Martin, Lucas Bandarkar, Nanyun Peng) представила шесть вариантов сжатия моделей машинного перевода. Базовой архитектурой выступила модель GPT-OSS-20B. Авторы применили метод Routing-Informed Expert Pruning, который позволяет физически удалять наименее важные «эксперты» (нейронные модули) в MoE-архитектуре, опираясь на данные о маршрутизации запросов.

Ключевая инновация заключается в двухэтапном отборе: сначала ранжирование экспертов на основе специфичной для задачи массы маршрутизации, затем распределение сохраняемой емкости по слоям с учетом кросс-лингвистического расхождения маршрутизации. После физического удаления «мусорных» весов модель проходит recovery-tuning на синтетических данных, сгенерированных GPT-5.1.

Технические детали и метрики

Метод включает не только pruning, но и агрессивное квантование: проекционные веса оставшихся экспертов были сжаты до формата MXFP4. Это позволило достичь экстремального сжатия артефактов при сохранении лингвистической точности. Команда протестировала модель на двух направлениях: Английский — Упрощенный китайский и Английский — Египетский арабский.

Параметр Значение / Диапазон
Базовая модель GPT-OSS-20B
Диапазон параметров (после сжатия) 4.186B – 7.770B
Размер упакованного артефакта 4.55 – 6.33 GiB
Метод квантования весов MXFP4
Источник данных для дообучения Синтетические данные GPT-5.1
Внутренняя оценка качества xCOMET-XL (с псевдо-референсами GPT-5.1)

Инфраструктура и надежность

Помимо самой модели, команда разработала robust inference system для условий WMT26. Система включает категоризацию инструкций, валидацию вывода, механизмы повторных попыток (retries), сегментированный фоллбэк и реконструкцию JSON, принадлежащего источнику. Это критически важно для промышленного внедрения, где стабильность вывода часто важнее абсолютного максимума BLEU.

Почему это важно

Результаты ESTS демонстрируют, что MoE-модели можно сжимать в 4-5 раз, не прибегая к полному переобучению с нуля. Использование routing mass как метрики важности эксперта оказывается эффективнее случайного или статистического отсечения. Сжатие до ~4.5 GiB делает такие модели потенциально пригодными для развертывания на edge-устройствах или в условиях ограниченных вычислительных ресурсов, сохраняя при этом конкурентоспособность с более крупными dense-моделями.

Источник: arXiv cs.CL ↗