Релиз модели12 августа 2026 г., 17:17 МСК🤖 Auto

LiquidAI LFM2.5-VL-3B: Быстрый VLM для edge-устройств с поддержкой GUI

LiquidAI представила LFM2.5-VL-3B — оптимизированную для периферийных устройств мультимодальную модель, которая превосходит аналоги в понимании экранов и вызове функций, работая на CPU и мобильных чипах.

Баннер новости 5618

Архитектура и обучение: 34 трлн токенов

Модель LFM2.5-VL-3B (3.1B параметров) построена на базе SigLIP2 400M NaFlex для кодирования изображений и текстового ядра LFM2.5-2.6B. Ключевое отличие от предыдущей версии LFM2-VL — увеличение объема визуальных данных в 4 раза и расширение словаря до 128K токенов для поддержки не-латинских скриптов без переобучения с нуля. Обучение включало SFT с дистилляцией знаний и Antidoom, а также многоэтапное RL с несколькими наградами.

Результаты бенчмарков: Лидер в классе 3B

LFM2.5-VL-3B демонстрирует выдающиеся результаты в задачах понимания интерфейсов (GUI) и работы с документами. В отличие от многих конкурентов, она не использует цепочки рассуждений (reasoning), что обеспечивает мгновенный отклик в реальном времени. Ниже приведено сравнение ключевых метрик с моделями размером 2B–8B:

Бенчмарк LFM2.5-VL-3B InternVL 3.5 4B Qwen3.5-4B gemma-4-E4B-it
ScreenSpot-v2 Web 82.2 82.6 77.8 47.6
ScreenSpot-v2 Mobile 81.2 87.8 81.4 60.3
DocVQA (val) 91.1 91.8 94.8 87.4
RefCOCO-avg (Grounding) 87.9 88.8 86.6 72.1
ToolSandbox (Tool Use) 59.5 N/A 65.0 61.6
BFCL V4 32.5 N/A 53.6 40.0

Особое внимание стоит уделить задаче ScreenSpot-v2 Desktop, где LFM2.5-VL-3B набрала 78.7, значительно опередив LFM2-VL-3B (6.0) и Gemma-4-E2B (28.1), что делает её одним из лучших решений для автоматизации работы с десктопными приложениями.

Производительность на Edge-устройствах

Модель оптимизирована для работы на ограниченном оборудовании. Она занимает около 3 ГБ памяти и поддерживает запуск через llama.cpp, MLX, vLLM и ONNX. Реальные скорости декодирования (tokens/s):

  • Apple M5 Max: 228 t/s
  • Ryzen AI Max+ 395: 116 t/s
  • Samsung Galaxy S26 Ultra: 20 t/s (полностью on-device)
На GPU (H100) модель достигает пропускной способности ~11 000 токенов в секунду при высокой конкурентности, что в 2 раза быстрее моделей класса 4B и позволяет обрабатывать почти 1 млрд выходных токенов в день на одной карте.

Практическое применение

LFM2.5-VL-3B особенно полезна для сценариев, требующих быстрого анализа UI, OCR документов и вызова функций (function calling) без задержек на генерацию «мыслей». Модель доступна в репозитории LiquidAI и совместима с transformers >=5.10.1. Для разработчиков доступны примеры кода для загрузки изображения, обработки чатов и генерации ответов с параметрами temperature=0.2 и top_k=50.

Бенчмарки

БенчмаркLFM2.5-VL-3B (3.1B)LFM2-VL-3B (3.1B)gemma-4-E2B-it (5.1B)gemma-4-E4B-it (8B)
MMStar63.3%57.7%45.3%52.9%
MME73.1%73%54.9%67.6%
RealWorldQA73.1%71.1%60%64.3%
SimpleVQA35.4%33%27.3%30.4%
SEED-Bench (image)77.7%76.6%71.4%75.3%
MMBench (dev EN v1.1)81%80%64.2%71.6%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Hugging Face blog ↗