Архитектура и обучение: 34 трлн токенов
Модель LFM2.5-VL-3B (3.1B параметров) построена на базе SigLIP2 400M NaFlex для кодирования изображений и текстового ядра LFM2.5-2.6B. Ключевое отличие от предыдущей версии LFM2-VL — увеличение объема визуальных данных в 4 раза и расширение словаря до 128K токенов для поддержки не-латинских скриптов без переобучения с нуля. Обучение включало SFT с дистилляцией знаний и Antidoom, а также многоэтапное RL с несколькими наградами.
Результаты бенчмарков: Лидер в классе 3B
LFM2.5-VL-3B демонстрирует выдающиеся результаты в задачах понимания интерфейсов (GUI) и работы с документами. В отличие от многих конкурентов, она не использует цепочки рассуждений (reasoning), что обеспечивает мгновенный отклик в реальном времени. Ниже приведено сравнение ключевых метрик с моделями размером 2B–8B:
| Бенчмарк | LFM2.5-VL-3B | InternVL 3.5 4B | Qwen3.5-4B | gemma-4-E4B-it |
|---|---|---|---|---|
| ScreenSpot-v2 Web | 82.2 | 82.6 | 77.8 | 47.6 |
| ScreenSpot-v2 Mobile | 81.2 | 87.8 | 81.4 | 60.3 |
| DocVQA (val) | 91.1 | 91.8 | 94.8 | 87.4 |
| RefCOCO-avg (Grounding) | 87.9 | 88.8 | 86.6 | 72.1 |
| ToolSandbox (Tool Use) | 59.5 | N/A | 65.0 | 61.6 |
| BFCL V4 | 32.5 | N/A | 53.6 | 40.0 |
Особое внимание стоит уделить задаче ScreenSpot-v2 Desktop, где LFM2.5-VL-3B набрала 78.7, значительно опередив LFM2-VL-3B (6.0) и Gemma-4-E2B (28.1), что делает её одним из лучших решений для автоматизации работы с десктопными приложениями.
Производительность на Edge-устройствах
Модель оптимизирована для работы на ограниченном оборудовании. Она занимает около 3 ГБ памяти и поддерживает запуск через llama.cpp, MLX, vLLM и ONNX. Реальные скорости декодирования (tokens/s):
- Apple M5 Max: 228 t/s
- Ryzen AI Max+ 395: 116 t/s
- Samsung Galaxy S26 Ultra: 20 t/s (полностью on-device)
Практическое применение
LFM2.5-VL-3B особенно полезна для сценариев, требующих быстрого анализа UI, OCR документов и вызова функций (function calling) без задержек на генерацию «мыслей». Модель доступна в репозитории LiquidAI и совместима с transformers >=5.10.1. Для разработчиков доступны примеры кода для загрузки изображения, обработки чатов и генерации ответов с параметрами temperature=0.2 и top_k=50.
Бенчмарки
| Бенчмарк | LFM2.5-VL-3B (3.1B) | LFM2-VL-3B (3.1B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) |
|---|---|---|---|---|
| MMStar | 63.3% | 57.7% | 45.3% | 52.9% |
| MME | 73.1% | 73% | 54.9% | 67.6% |
| RealWorldQA | 73.1% | 71.1% | 60% | 64.3% |
| SimpleVQA | 35.4% | 33% | 27.3% | 30.4% |
| SEED-Bench (image) | 77.7% | 76.6% | 71.4% | 75.3% |
| MMBench (dev EN v1.1) | 81% | 80% | 64.2% | 71.6% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Hugging Face blog ↗
