Релиз модели21 августа 2026 г., 19:47 МСК🤖 Auto

CMD: новый метод дистилляции для ускорения LLM без потери качества

Исследователи представили Context-Matched Distillation (CMD) — метод, который позволяет малым языковым моделям достигать производительности больших моделей, обучаясь на контекстно-согласованных данных.

Баннер новости 6256

Проблема масштабирования LLM

Тренировка больших языковых моделей (LLM) требует огромных вычислительных ресурсов. Чтобы сделать ИИ доступнее, исследователи используют дистилляцию знаний — передачу «мудрости» от большой модели-учителя к маленькой модели-студенту. Однако стандартные методы часто теряют нюансы контекста, что снижает качество ответов малых моделей.

Что такое CMD?

Новый метод Context-Matched Distillation (CMD) решает эту проблему, создавая обучающие данные, которые точно соответствуют распределению контекстов, с которыми сталкивается большая модель. Вместо случайной выборки данных, CMD генерирует пары «вопрос-ответ», где контекст максимально близок к реальному использованию большой модели.

Ключевые преимущества

  • Высокая эффективность: Малые модели, обученные с помощью CMD, показывают результаты, сопоставимые с моделями в 10 раз больше по параметрам.
  • Снижение затрат: Метод позволяет использовать более дешевые и быстрые модели для задач, требующих высокой точности.
  • Генерация данных: CMD использует саму большую модель для создания высококачественных обучающих примеров, что устраняет необходимость в ручной разметке.

Результаты тестирования

Эксперименты показали, что модели, обученные с CMD, превосходят аналоги, обученные стандартными методами дистилляции, на бенчмарках MMLU и GSM8K. Особенно заметен прирост в задачах, требующих глубокого понимания контекста и логического вывода.

Метрика Стандартная дистилляция CMD (Context-Matched)
MMLU (General Knowledge) 65.2% 71.8%
GSM8K (Math Reasoning) 42.1% 58.4%
Инференс скорость (относ.) 1.0x 1.0x

Значение для индустрии

CMD открывает путь к созданию эффективных ИИ-ассистентов, которые могут работать на устройствах с ограниченными ресурсами (edge devices), не жертвуя качеством ответов. Это важный шаг к демократизации доступа к мощным языковым моделям.

Источник: Github ↗