В мире искусственного интеллекта существует вечное противоречие: чем мощнее модель, тем больше она требует вычислительных ресурсов, и наоборот, легковесные решения часто уступают в качестве. Компания LiquidAI предлагает элегантное решение этой дилеммы, выпуская LFM2.5-VL-3B. Это не просто очередная версия модели, а флагманский инструмент для компьютерного зрения и обработки естественного языка, спроектированный специально для работы «на краю» (edge computing) — то есть непосредственно на устройствах пользователей, без необходимости отправки данных в облако. В этой статье мы подробно разберем, как устроена эта модель, почему она быстрее и точнее предшественников, и как вы можете запустить её на своем оборудовании уже сегодня.
LFM2.5-VL-3B — это самая способная модель с поддержкой зрения и языка, которую можно запустить на собственном оборудовании. Она понимает документы и экраны, определяет объекты (grounding), вызывает функции (function calling) и отвечает напрямую, без долгих рассуждений, что критически важно для реального времени и приложений на устройстве. В отличие от многих современных LLM, которые тратят секунды на «размышления» перед ответом, эта модель оптимизирована для мгновенного отклика, сохраняя при этом высокую точность.
01Четыре ключевых улучшения: от экранов до инструментов
LFM2.5-VL-3B расширяет возможности предыдущих релизов LiquidAI за счет четырех фундаментальных улучшений. Давайте разберем каждое из них, чтобы понять, что именно делает эту модель уникальной на рынке легковесных мультимодальных систем.
1. Понимание экранов и интерфейсов (Screen/UI Understanding)
Одной из самых сложных задач для ИИ является понимание цифровых экранов. Ранние модели часто путались в интерфейсах, не различая кнопки, поля ввода и текстовые блоки. LFM2.5-VL-3B демонстрирует сильное понимание цифровых экранов различных устройств. Это означает, что модель может не просто «увидеть» скриншот, но и интерпретировать его как интерфейс пользователя: определить, где находится кнопка «Отправить», что написано в поле поиска, или как расположены элементы на мобильном экране. Это открывает двери для создания автономных агентов, которые могут управлять приложениями на вашем телефоне или компьютере.

2. Grounding и обнаружение объектов
Grounding (заземление) в контексте компьютерного зрения — это способность модели связывать текстовые запросы с конкретными визуальными объектами. Если вы спросите: «Где находится красный мяч?», модель должна не только описать сцену, но и точно указать, где именно находится этот объект. LFM2.5-VL-3B значительно улучшила эту способность, используя естественные языковые запросы. Это делает взаимодействие с моделью более интуитивным и точным, особенно в задачах навигации, анализа документов или поиска конкретных элементов на изображении.
3. Многокадровый ввод (Multi-image input)
Реальный мир редко ограничивается одним изображением. Часто для принятия решения нужно сравнить несколько кадров: например, сравнить два документа, проанализировать последовательность действий на видео или сопоставить фото товара с его описанием. LFM2.5-VL-3B улучшила способность к рассуждению при работе с несколькими изображениями одновременно. Модель может анализировать контекст, выявлять изменения и делать выводы на основе совокупности визуальной информации, что значительно расширяет сферу её применения.

4. Вызов функций (Function Calling)
Это, пожалуй, самое важное улучшение для разработчиков. LFM2.5-VL-3B стала значительно сильнее в вызове функций как в текстовых, так и в визуальных сценариях. Это означает, что модель может не только отвечать на вопросы, но и выполнять действия: отправлять запросы к API, запускать скрипты или управлять другими программами. В сочетании с пониманием экрана, это превращает модель в полноценного цифрового помощника, способного действовать, а не просто говорить.

02Как обучали самую способную модель
За такими результатами стоит сложная архитектура и масштабный процесс обучения. LFM2.5-VL-3B сочетает в себе визуальный энкодер SigLIP2 400M NaFlex с тем же предварительно обученным ядром, что и текстовая модель LFM2.5-2.6B. Это позволяет модели эффективно объединять визуальные и текстовые представления.
Модель предварительно обучена на около 34 триллионов токенов, что является впечатляющим объемом данных. При этом количество визуальных данных увеличено в 4 раза по сравнению с предыдущими версиями. Данные отобраны из тщательно курируемых и синтетических наборов, включающих подписи к изображениям, оптическое распознавание символов (OCR), grounding и инструкции для следования указаниям. Особое внимание уделено поддержке нелатинских скриптов: размер словаря был увеличен до 128K за счет расширения токенизатора «на месте», а не переобучения с нуля, что сэкономило ресурсы и время.
Постобучение (post-training) проходит в два этапа. Первый — это контролируемое тонкое обучение (SFT) с дистилляцией знаний от более крупной модели-учителя и использованием метода Antidoom. Второй этап — это многокритериальное обучение с подкреплением (RL), которое помогает модели лучше следовать инструкциям и избегать галлюцинаций.
03Результаты бенчмарков: лидерство в своем классе
Чтобы оценить реальные возможности LFM2.5-VL-3B, команда LiquidAI провела обширное тестирование по множеству визуальных и текстовых бенчмарков. Давайте посмотрим на цифры, которые говорят сами за себя.

Визуальные задачи
Визуальные бенчмарки охватывают многоязычное визуальное понимание, следование инструкциям, визуальную математику и научные рассуждения, понимание документов, обнаружение объектов, понимание нескольких изображений и анализ экранов. LFM2.5-VL-3B лидирует в своем классе по размеру на реальных задачах с изображениями, а также отлично читает цифровой контент — от документов и графиков до элементов пользовательского интерфейса.
Например, в бенчмарке MMStar (общее понимание) модель набрала 63.3 балла, что значительно выше, чем у Gemma-4-E2B-it (45.3) и InternVL 3.5 2B (57.7). В задаче ScreenSpot-v2 Desktop (поиск элементов на рабочем столе) LFM2.5-VL-3B показала результат 78.7, в то время как предыдущая версия LFM2-VL-3B показала лишь 6.0, а даже более крупные модели, такие как Gemma-4-E4B-it, набрали только 45.8. Это демонстрирует прорыв в понимании интерфейсов.
В задачах OCR (оптическое распознавание) модель также показывает отличные результаты. В OCRBench v1 она набрала 84.2, что сопоставимо с лидерами, а в TextVQA — 84.3. Важно отметить, что модель работает в режиме без рассуждений (non-reasoning mode), что позволяет ей отвечать мгновенно, не жертвуя точностью.
Текстовые задачи и вызов функций
LFM2.5-VL-3B также отлично справляется с текстовыми задачами. В бенчмарке IFEval (следование инструкциям) она набрала 82.3, что близко к лидерам вроде Gemma-4-E4B-it (87.9). Но самое интересное происходит в задачах вызова функций (Tool use & function calling). В бенчмарке ToolSandbox модель набрала 59.5, что сопоставимо с Gemma-4-E2B-it (56.5) и значительно лучше, чем у Qwen3.5-2B (47.7). В BFCL V4 результат составил 32.5, что также является сильным показателем для модели такого размера.
04Скорость вывода: CPU, GPU и Edge
Одно из главных преимуществ LFM2.5-VL-3B — это скорость. Модель поддерживает запуск на различных платформах «из коробки», включая llama.cpp, MLX, vLLM, SGLang и ONNX.
Локальный запуск (On-device)
На устройстве Apple M5 Max модель декодирует 228 токенов в секунду, а на Ryzen AI Max+ 395 — 116 токенов в секунду. При этом она занимает всего около 3 ГБ памяти. Это позволяет запускать её даже на мобильных устройствах, таких как Galaxy S26 Ultra, где скорость составляет около 20 токенов в секунду. Это делает LFM2.5-VL-3B идеальным кандидатом для приватных приложений, где данные не покидают устройство.
Запуск на GPU
На графических процессорах модель демонстрирует стабильно низкую задержку и является самой быстрой при работе с многокадровыми вводами. По пропускной способности вывода (output throughput) LFM2.5-VL-3B также лидирует среди протестированных моделей, достигая около 11 000 токенов в секунду при высокой конкурентности. Это примерно в 2 раза быстрее, чем более крупные модели класса 4B, и опережает даже более мелкие модели класса 2B. На одном GPU H100 это может означать обработку почти 1 миллиарда выходных токенов в день.

05Как использовать LFM2.5-VL-3B
Запустить модель очень просто, если у вас есть доступ к Python-окружению. Ниже приведен пример кода для загрузки и запуска модели через библиотеку Hugging Face Transformers.
import torch
from transformers.image_utils import load_image
from transformers import AutoModelForImageTextToText, AutoProcessor
from IPython.display import display
MODEL_ID = "LiquidAI/LFM2.5-VL-3B"
processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForImageTextToText.from_pretrained(
MODEL_ID,
device_map="auto",
dtype="bfloat16"
)
img_url = "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/coco_sample.png"
input_image = load_image(img_url)
display(input_image)
messages = [
{
"role": "user",
"content": [
{"type": "image", "image": input_image},
{"type": "text", "text": "Describe this image in two concise sentences."},
],
}
]
inputs = processor.apply_chat_template(
messages,
add_generation_prompt=True,
tokenize=True,
return_dict=True,
return_tensors="pt"
).to(model.device)
with torch.inference_mode():
outputs = model.generate(
**inputs,
do_sample=True,
temperature=0.2,
top_k=50,
repetition_penalty=1.0,
max_new_tokens=256
)
output = processor.batch_decode(outputs[:, inputs["input_ids"].shape[1]:], skip_special_tokens=True)[0]
print(output)Этот код загрузит изображение с двумя кошками на розовом диване и выдаст краткое описание. Вы можете найти больше примеров в документации LiquidAI, включая работу с несколькими изображениями, grounding, OCR и вызовом функций.
06Что это значит на практике
Появление LFM2.5-VL-3B меняет правила игры для разработчиков, работающих с компьютерным зрением. Вот несколько сценариев, где эта модель может стать незаменимой:
- Приватные ассистенты: Благодаря локальному запуску и малому размеру памяти, вы можете создать голосового или визуального ассистента, который работает полностью офлайн. Ваши фотографии документов или скриншотов не будут отправляться в облако, что гарантирует полную конфиденциальность.
- Автоматизация интерфейсов: Разработчики могут использовать модель для создания ботов, которые управляют веб-страницами или десктопными приложениями. Модель может «видеть» интерфейс, находить нужные кнопки и нажимать их, выполняя рутинные задачи.
- Анализ документов в реальном времени: Благодаря сильному OCR и пониманию документов, модель может мгновенно извлекать данные из счетов, контрактов или отчетов, даже если они представлены в виде изображений.
- Мобильные приложения: Скорость работы на мобильных устройствах (даже 20 токенов/с на флагманских смартфонах) позволяет интегрировать ИИ-функции в мобильные приложения без задержек, характерных для облачных API.
LFM2.5-VL-3B доступна на Hugging Face. Вы можете скачать её, попробовать в веб-демо или начать тонкую настройку под свои задачи. LiquidAI продолжает двигаться к своей цели — сделать ИИ доступным везде, где бы вы ни находились.
Источник: Hugging Face ↗
