Главная/Блог/Аналитика/LiquidAI QAD: Как запустить LFM2.5 на…
Аналитика9 мин чтения · 19 августа 2026 г.

LiquidAI QAD: Как запустить LFM2.5 на граничных устройствах без потери качества

LiquidAI представили квантованные модели LFM2.5 с использованием Quantization-Aware Distillation. Разбираем, как это работает, почему это важно для локального запуска и как использовать новые чекпоинты.

LiquidAI QAD: Как запустить LFM2.5 на граничных устройствах без потери качества

В мире локальных больших языковых моделей (LLM) вечным компромиссом остается баланс между скоростью, размером модели и качеством генерации. Обычно, чтобы запустить нейросеть на своем ноутбуке, смартфоне или даже Raspberry Pi, разработчики идут на жертвы: квантуют модель, снижая точность чисел с плавающей запятой до 4 бит. Это экономит память и ускоряет вычисления, но часто приводит к заметному падению интеллектуальных способностей модели. Однако команда LiquidAI предлагает решение, которое меняет правила игры. Они выпустили новые чекпоинты для семейства LFM2.5, использующие технологию Quantization-Aware Distillation (QAD), позволяющую сохранить почти полную точность оригинальных моделей при экстремально низком потреблении ресурсов.

Это не просто еще одна оптимизация. Это фундаментальный сдвиг в подходе к развертыванию AI на edge-устройствах (граничных устройствах). В этой статье мы подробно разберем, что такое QAD, как она работает, какие результаты показывают бенчмарки и почему это открытие может сделать мощные AI-ассистенты доступными для миллионов устройств, которые раньше считались слишком слабыми для таких задач. Мы также рассмотрим практические аспекты запуска этих моделей в России, где доступ к некоторым облачным сервисам ограничен, а локальный инференс становится единственным надежным способом работы с AI.

01Что такое LFM2.5 и почему квантование важно?

Семейство моделей LFM2.5 от LiquidAI включает в себя несколько архитектурных размеров: от компактных 230 миллионов и 350 миллионов параметров до более крупных 1.2 миллиарда и 2.6 миллиарда. Эти модели разработаны с упором на эффективность и способность работать в условиях ограниченных вычислительных ресурсов. Однако, даже «легкие» модели требуют значительных ресурсов для работы в стандартном формате BF16 (half-precision floating point). Для сравнения, модель LFM2.5-2.6B в формате BF16 занимает около 5 ГБ видеопамяти. Это уже требует серьезной видеокарты, что недоступно для большинства обычных пользователей.

Квантование — это процесс преобразования весов модели из высокоточных чисел (например, 16-битных) в числа с меньшей разрядностью (например, 4-битные). Формат Q4_0, о котором идет речь в релизе LiquidAI, использует 4 бита для хранения каждого веса. Теоретически, это должно сократить объем памяти в 4 раза по сравнению с BF16. Но на практике, простое отсечение битов (Post-Training Quantization, PTQ) часто приводит к тому, что модель «забывает» сложные паттерны, которые она выучила во время обучения. Результат — модель становится быстрее, но начинает галлюцинировать, терять логику в рассуждениях и хуже следовать инструкциям. Именно эту проблему и призвана решить технология QAD.

02Quantization-Aware Distillation: Магия обучения

Ключевым нововведением LiquidAI является метод Quantization-Aware Distillation (QAD). В отличие от традиционного подхода, где модель сначала обучается в полном精度 (high-precision), а затем «обрезается» для квантования, QAD интегрирует процесс квантования непосредственно в цикл обучения. Представьте себе учителя и ученика. В классической дистилляции учитель (точная модель BF16) передает знания ученику (квантованной модели). Но в QAD учитель знает, что ученик будет работать в «ограниченных условиях» (4 бита), и поэтому адаптирует свои объяснения так, чтобы ученик мог их усвоить именно в таком формате.

Технически это означает, что во время обучения квантованной модели (студента) в процесс добавляется шум, имитирующий ошибки квантования. Модель учится компенсировать эти ошибки, находя более устойчивые представления данных. В результате, финальная квантованная модель оказывается значительно более «умной», чем та, которая была бы получена простым пост-обучающим квантованием. LiquidAI заявляют, что их подход позволяет восстановить 97% точности, которая обычно теряется при квантовании. Это поразительный результат, который стирает грань между «быстрой, но глупой» моделью и «медленной, но умной».

💡
Почему это важно для разработчиков. Раньше, чтобы получить качественную квантованную модель, нужно было либо переобучать её с нуля (что дорого и долго), либо мириться с падением качества. QAD позволяет взять уже обученную точную модель и эффективно «перепрошить» её под квантованный формат, сохраняя 97% её интеллектуального потенциала.

03Результаты бенчмарков: Сравнение с эталонами

Чтобы доказать эффективность QAD, LiquidAI провели обширное тестирование. Они сравнили свои новые QAD Q4_0 чекпоинты с моделями, квантованными стандартным методом PTQ, а также с эталонными моделями BF16. Тестирование проводилось на широком спектре задач: от логического мышления и следования инструкциям до использования инструментов и агентных сценариев. Использовались такие известные бенчмарки, как GPQA Diamond (для сложных научных вопросов), MMLU-Pro (универсальные знания), IFEval и IFBench (следование инструкциям), а также BFCLv4 (безопасность и контроль).

Результаты оказались впечатляющими. Для всех четырех моделей семейства LFM2.5, QAD чекпоинты сохранили от 96.5% до 97.4% от производительности оригинальных моделей BF16. Это означает, что падение качества практически незаметно. Например, модель LFM2.5-230M QAD Q4_0 показала результаты, сопоставимые с качеством модели Q5_K_M (5-битной квантованной версии), но при этом работала быстрее. Аналогично, модели 1.2B и 2.6B показали качество, сравнимое с Q4_K_M, но с преимуществом в скорости декодирования на 3-14%.

LiquidAI QAD: Как запустить LFM2.5 на граничных устройствах без потери качества

Особое внимание стоит уделить сравнению с Unsloth UD-Q4_K_XL. Unsloth — это популярный инструмент для оптимизации LLM, и их UD-Q4_K_XL считается одним из сильнейших методов пост-обучающего квантования. QAD от LiquidAI не просто сравнялась с ним, но и превзошла его в некоторых метриках, особенно для моделей 230M и 1.2B. Это подтверждает, что подход «обучения с учетом квантования» дает существенное преимущество перед простыми методами сжатия.

04Скорость и размер: Реальные тесты на edge-устройствах

Теория — это хорошо, но для разработчиков критически важна практика. LiquidAI протестировали свои модели на четырех совершенно разных устройствах, представляющих разные классы hardware: MacBook Pro (GPU inference), NucBox EVO-X2 (GPU inference), Samsung Galaxy S26 Ultra (Arm CPU inference) и Raspberry Pi 5 (Arm CPU inference). Это позволяет оценить, как модели будут вести себя в реальных сценариях: от мощных ноутбуков до бюджетных одноплатных компьютеров.

На MacBook Pro и NucBox, где используется GPU, модели LFM2.5-230M и 350M в формате QAD Q4_0 показали скорость декодирования на 4-33% выше, чем их аналоги в формате Q5_K_M, при этом сохраняя сопоставимое качество. Для более крупных моделей 1.2B и 2.6B преимущество составило 3-14% по сравнению с Q4_K_M. На мобильных устройствах (Samsung) и Raspberry Pi, где вычисления идут на CPU, преимущества также очевидны. Меньший размер модели означает меньше операций чтения из памяти, что является узким местом для CPU. Таким образом, QAD Q4_0 чекпоинты обеспечивают максимальную скорость на любом устройстве, не жертвуя качеством.

LiquidAI QAD: Как запустить LFM2.5 на граничных устройствах без потери качества

05Как использовать QAD GGUF файлы

Одним из главных преимуществ LiquidAI является открытость их решений. Новые чекпоинты LFM2.5 доступны в формате GGUF, который является стандартом де-факто для локального запуска LLM. Это означает, что вы можете использовать их с любым популярным runtime, поддерживающим GGUF, таким как llama.cpp, Ollama, LM Studio или AnyLLM. Формат GGUF удобен тем, что он позволяет легко переключаться между разными уровнями квантования и оптимизациями без необходимости перекомпиляции кода.

Для запуска модели через командную строку llama.cpp, вам понадобится всего несколько строк. Например, чтобы запустить модель LFM2.5-350M с запросом «What is C. elegans?», вы можете использовать следующую команду:

terminalbash
llama-cli -hf LiquidAI/LFM2.5-350M \
  --hf-file LFM2.5-350M-QAD-Q4_0.gguf \
  -p "What is C. elegans?"

Эта команда автоматически загрузит модель с Hugging Face (если у вас есть доступ) или использует локальный файл, если вы скачали его заранее. Важно отметить, что для работы с Hugging Face в России могут возникнуть сложности из-за блокировок или медленной скорости загрузки. В таком случае, рекомендуется скачать GGUF файл вручную через браузер или специальные менеджеры загрузчиков, а затем указать путь к локальному файлу в параметре --hf-file (или использовать локальный путь, если ваш клиент поддерживает это).

⚠️ Важно для пользователей из РФ.
Прямой доступ к Hugging Face может быть нестабильным. Рекомендуется использовать зеркала Hugging Face или скачивать модели через торренты/FTP, если они доступны. Также убедитесь, что ваша версия llama.cpp обновлена до последней версии, чтобы поддерживать все оптимизации QAD.

06Доступность моделей и где их скачать

Все четыре модели семейства LFM2.5 теперь доступны для скачивания на Hugging Face в формате QAD Q4_0. Это включает:

  • LFM2.5-230M: Идеально для самых слабых устройств, таких как старые смартфоны или IoT-устройства.
  • LFM2.5-350M: Отличный баланс между размером и интеллектом для мобильных устройств.
  • LFM2.5-1.2B-Instruct: Оптимизирована для инструкций, подходит для ноутбуков и средних ПК.
  • LFM2.5-2.6B: Самая мощная модель в линейке, способная на сложные рассуждения и работу с контекстом.

Каждая модель доступна в виде GGUF файла, готового к использованию. LiquidAI также предоставили подробную документацию и примеры использования, что делает процесс интеграции максимально простым. Для исследователей и энтузиастов это отличная возможность поэкспериментировать с передовыми методами квантования без необходимости собственных вычислительных ресурсов для обучения.

LiquidAI QAD: Как запустить LFM2.5 на граничных устройствах без потери качества

07Почему это меняет рынок локального AI

Релиз QAD Q4_0 от LiquidAI знаменует собой важный этап в демократизации искусственного интеллекта. Раньше, чтобы использовать мощные AI-модели, нужно было либо платить за облачные API, либо иметь дорогое оборудование. Теперь, благодаря таким оптимизациям, качественные AI-ассистенты могут работать на устройствах, которые есть у большинства людей. Это открывает путь для создания приватных, офлайн-работающих приложений, которые не зависят от интернета и корпоративных серверов.

Кроме того, это снижает барьер для входа в разработку AI-приложений. Не нужно быть экспертом в распределенных вычислениях, чтобы запустить модель. Достаточно скачать GGUF файл и запустить его через llama.cpp. Это особенно важно для образовательных проектов, где студенты могут изучать работу LLM на своих личных ноутбуках, не тратя деньги на облачные ресурсы.

LiquidAI QAD: Как запустить LFM2.5 на граничных устройствах без потери качества

08Что это значит на практике

Для обычного пользователя это означает, что ваш смартфон или ноутбук может стать полноценным AI-ассистентом. Вы можете использовать LFM2.5-2.6B для анализа документов, написания кода или создания контента прямо на устройстве, без отправки данных в облако. Это гарантирует конфиденциальность и скорость работы, так как не нужно ждать ответа от сервера. Для разработчиков это возможность создавать приложения, которые работают офлайн, что критически важно для сфер, связанных с безопасностью данных, таких как медицина или финансы.

Также стоит отметить, что технология QAD может стать стандартом для будущих квантованных моделей. Если другие компании начнут использовать этот подход, мы увидим резкий рост качества локальных AI-моделей. Это приведет к тому, что «легкие» модели станут по-настоящему полезными, а не просто игрушками для тестирования. В конечном итоге, это приближает нас к эпохе, когда каждый человек будет иметь доступ к персональному, умному и приватному AI-помощнику, работающему на его собственном устройстве.

LiquidAI QAD: Как запустить LFM2.5 на граничных устройствах без потери качества

Мы рекомендуем всем, кто интересуется локальным AI, попробовать новые модели LFM2.5 от LiquidAI. Экспериментируйте с разными размерами, сравнивайте результаты с другими квантованными моделями и делитесь своими находками. Возможно, именно вы найдете новый способ применения этих технологий, который изменит то, как мы взаимодействуем с искусственным интеллектом в повседневной жизни.

Источник: Hugging Face ↗