Релиз модели19 августа 2026 г., 17:17 МСК🤖 Auto

LiquidAI выпустила LFM2.5 Q4_0: 97% качества BF16 на edge-устройствах

LiquidAI представила модели LFM2.5, обученные через квантование-осознанную дистилляцию (QAD). Новые чекпоинты Q4_0 сохраняют 97% точности от BF16, превосходя стандартное пост-тренировочное квантование по скорости и качеству.

Баннер новости 6078

Суть прорыва: QAD против PTQ

Компания LiquidAI опубликовала новые веса для моделей LFM2.5 (230M, 350M, 1.2B-Instruct, 2.6B) в формате GGUF с квантованием Q4_0. Ключевое отличие — использование метода Quantization-Aware Distillation (QAD). В отличие от стандартного пост-тренировочного квантования (PTQ), где модель просто «сжимают» после обучения, QAD использует высокоточную модель-учителя для обучения квантованной модели-студента. Это позволяет нивелировать потерю качества, типичную для 4-битного формата.

Результат: QAD-чекпоинты восстанавливают 97.1%–97.4% точности, теряемой при переходе от BF16 к Q4_0. Это делает их практически неотличимыми от полноточных версий в большинстве задач, но при этом они остаются легкими для запуска на мобильных устройствах.

Результаты бенчмарков

Модели протестированы на наборах данных GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF, BFCLv4, а также на математических задачах GSM8K и AIME25. Ниже приведено сравнение сохранения качества относительно базовой модели BF16:

Модель Сохранение точности (QAD Q4_0 vs BF16) Ключевые метрики
LFM2.5-230M 97.1% Тест: GSM8K
LFM2.5-350M 96.5% Тест: GSM8K
LFM2.5-1.2B-Instruct 97.4% Тест: AIME25
LFM2.5-2.6B 96.6% Тест: AIME25

Производительность на реальном железе

Тесты проводились на MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra и Raspberry Pi 5. QAD Q4_0 демонстрирует превосходство над альтернативными методами квантования:

  • Малые модели (230M/350M): По качеству соответствуют Q5_K_M, но работают на 4–33% быстрее.
  • Средние модели (1.2B/2.6B): По качеству соответствуют Q4_K_M, но обеспечивают прирост скорости на 3–14%.
  • Сравнение с Unsloth: QAD Q4_0 сопоставим с продвинутым методом UD-Q4_K_XL от Unsloth, но с лучшей оптимизацией под формат GGUF.

Как запустить

Файлы доступны на Hugging Face и совместимы с llama.cpp и другими рантаймами, поддерживающими GGUF Q4_0. Пример запуска через CLI:

llama-cli -hf LiquidAI/LFM2.5-350M \
  --hf-file LFM2.5-350M-QAD-Q4_0.gguf \
  -p "What is C. elegans?"

Чекпоинты уже доступны для загрузки: LiquidAI/LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct и LFM2.5-2.6B.

Источник: Hugging Face blog ↗