Суть прорыва: QAD против PTQ
Компания LiquidAI опубликовала новые веса для моделей LFM2.5 (230M, 350M, 1.2B-Instruct, 2.6B) в формате GGUF с квантованием Q4_0. Ключевое отличие — использование метода Quantization-Aware Distillation (QAD). В отличие от стандартного пост-тренировочного квантования (PTQ), где модель просто «сжимают» после обучения, QAD использует высокоточную модель-учителя для обучения квантованной модели-студента. Это позволяет нивелировать потерю качества, типичную для 4-битного формата.
Результат: QAD-чекпоинты восстанавливают 97.1%–97.4% точности, теряемой при переходе от BF16 к Q4_0. Это делает их практически неотличимыми от полноточных версий в большинстве задач, но при этом они остаются легкими для запуска на мобильных устройствах.
Результаты бенчмарков
Модели протестированы на наборах данных GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF, BFCLv4, а также на математических задачах GSM8K и AIME25. Ниже приведено сравнение сохранения качества относительно базовой модели BF16:
| Модель | Сохранение точности (QAD Q4_0 vs BF16) | Ключевые метрики |
|---|---|---|
| LFM2.5-230M | 97.1% | Тест: GSM8K |
| LFM2.5-350M | 96.5% | Тест: GSM8K |
| LFM2.5-1.2B-Instruct | 97.4% | Тест: AIME25 |
| LFM2.5-2.6B | 96.6% | Тест: AIME25 |
Производительность на реальном железе
Тесты проводились на MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra и Raspberry Pi 5. QAD Q4_0 демонстрирует превосходство над альтернативными методами квантования:
- Малые модели (230M/350M): По качеству соответствуют Q5_K_M, но работают на 4–33% быстрее.
- Средние модели (1.2B/2.6B): По качеству соответствуют Q4_K_M, но обеспечивают прирост скорости на 3–14%.
- Сравнение с Unsloth: QAD Q4_0 сопоставим с продвинутым методом UD-Q4_K_XL от Unsloth, но с лучшей оптимизацией под формат GGUF.
Как запустить
Файлы доступны на Hugging Face и совместимы с llama.cpp и другими рантаймами, поддерживающими GGUF Q4_0. Пример запуска через CLI:
llama-cli -hf LiquidAI/LFM2.5-350M \
--hf-file LFM2.5-350M-QAD-Q4_0.gguf \
-p "What is C. elegans?"
Чекпоинты уже доступны для загрузки: LiquidAI/LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct и LFM2.5-2.6B.
Источник: Hugging Face blog ↗
