Главная/Блог/Гайд/LFM2.5-VL-DSpark: Ускорение…
Гайд9 мин чтения · 24 сентября 2026 г.

LFM2.5-VL-DSpark: Ускорение мультимодальных моделей на 3x

LiquidAI представили экспериментальную модель-черновик DSpark для LFM2.5-VL-3B, обеспечивающую ускорение вывода до 3.13x на устройствах Apple и 2.66x на GPU H100 без потери качества.

LFM2.5-VL-DSpark: Ускорение мультимодальных моделей на 3x

В мире искусственного интеллекта, где скорость ответа модели часто становится критическим фактором для пользовательского опыта, каждый процент прироста производительности на счету. Компания LiquidAI продолжает расширять границы возможного для локального запуска больших языковых и мультимодальных моделей, выпуская экспериментальную модель-черновик (draft model) под названием LFM2.5-VL-DSpark. Эта разработка предназначена для работы в паре с их флагманской мультимодальной моделью LFM2.5-VL-3B и использует технологию спекулятивного декодирования (speculative decoding) для радикального ускорения генерации текста на основе визуальных данных.

Что делает этот релиз особенным? В отличие от многих оптимизаций, которые требуют перетренировки основной модели или сложной инфраструктуры, LFM2.5-VL-DSpark добавляет «спекулятивный путь» декодирования. Это означает, что вы получаете значительный прирост скорости при минимальном увеличении потребления памяти, и, что самое важное, качество выходных данных остается идентичным оригинальной модели. Для разработчиков, работающих с компьютерным зрением и обработкой естественного языка (NLP) на edge-устройствах или в облачных средах, это открывает новые горизонзы для создания отзывчивых приложений.

01Как работает спекулятивное декодирование для мультимодальных моделей?

Чтобы понять ценность LFM2.5-VL-DSpark, нужно разобраться в механике спекулятивного декодирования (Speculative Decoding). В традиционных больших языковых моделях (LLM) процесс генерации текста состоит из двух основных этапов: префилла (prefill) и декодирования (decode). Префилл обрабатывает входной промпт, а декодирование генерирует токены по одному. На мобильных устройствах и даже на некоторых GPU этап декодирования становится узким местом, так как он требует последовательных вычислений.

Спекулятивное декодирование решает эту проблему, используя две модели: основную (target) и черновую (draft). Черновая модель, которая меньше и быстрее, предсказывает блок из k токенов. Затем основная модель проверяет эти токены параллельно. Если предсказания совпадают, они принимаются сразу, что позволяет пропустить несколько шагов итеративного декодирования. Если есть расхождения, основная модель корректирует траекторию. В случае с LFM2.5-VL-DSpark, архитектура черновой модели зеркально отражает подход LiquidAI к текстовым моделям LFM2.5-DSpark.

Ключевая особенность для мультимодальных задач заключается в том, что визуальный черновик использует ту же архитектуру, что и текстовый. Он захватывает скрытые состояния (hidden states) основной модели на фиксированном наборе слоев и использует их для条件ирования (conditioning) при генерации кандидата. Важно отметить, что патчи изображения и текстовые токены проецируются в общее пространство представлений до этих слоев. Это означает, что черновая модель оперирует векторами скрытых состояний одинаковой размерности, независимо от модальности входа. Алгоритм вывода при этом остается неизменным по сравнению с текстовыми моделями, что упрощает интеграцию.

Сравнение производительности декодирования на различных устройствах: Apple M5 Max, M3 Ultra и NVIDIA H100.
Сравнение производительности декодирования на различных устройствах: Apple M5 Max, M3 Ultra и NVIDIA H100.

02Архитектура и обучение: баланс между размером и скоростью

Разработчики LiquidAI следовали проверенному рецепту DSpark, используя смесь данных для обучения с учителем (SFT) в области зрения и языка. Особый акцент был сделан на рабочих нагрузках, которые, по прогнозам, будут наиболее востребованы пользователями. В ходе абляционных исследований (ablations) команда тестировала различные конфигурации, варьируя количество слоев (3, 4 и 5) и размер блока.

Итоговая архитектура черновой модели представляет собой упрощенный «attention-only» черновик с 4 слоями и размером блока 9. Обучение проводилось в течение 10 эпох на финальной смеси данных. Команда измеряла коэффициент принятия токенов (acceptance rate) после каждой эпохи и наблюдала улучшение метрик по мере добавления обучающих токенов, пока не достигли эффекта убывающей отдачи. На этапе инференса рекомендуется использовать размер блока 8 или 9 в зависимости от конкретного аппаратного обеспечения.

Результирующая черновая модель содержит около 280 миллионов параметров. Это критически важный показатель, так как он увеличивает общее количество параметров развертываемой модели всего на 8.9% по сравнению с базовой моделью LFM2.5-VL-3B. Такое минимальное увеличение памяти позволяет использовать эту технологию даже на устройствах с ограниченными ресурсами, где каждый мегабайт VRAM на вес золота.

💡
Совет по оптимизации. Размер блока (block size) является ключевым параметром. Для Apple Silicon (M-серии) и NVIDIA H100 оптимальные значения могут отличаться. Всегда проверяйте конфигурацию вашего конкретного железа, так как слишком большой блок может привести к накладным расходам на проверку, а слишком маленький — не даст эффекта ускорения.

Детальная структура параметров

Ниже приведена разбивка параметров черновой модели LFM2.5-VL-3B-DSpark, что позволяет разработчикам лучше понять распределение вычислительных ресурсов:

  • Decoder stack (4 layers): 193.0M параметров. Это ядро модели, отвечающее за обработку последовательностей.
  • Hidden-state projection: 21.0M параметров. Отвечает за проекцию состояний в общее пространство.
  • Markov head: 65.5M параметров. Используется для предсказания следующих токенов на основе марковских свойств.
  • Norms + confidence head: 6.4k параметров. Небольшой блок для нормализации и оценки уверенности.

Итого: 279.5M параметров.

Диаграмма распределения параметров в черновой модели DSpark (279.5M параметров).
Диаграмма распределения параметров в черновой модели DSpark (279.5M параметров).

03Результаты производительности: от Apple Silicon до H100

Одной из главных целей релиза было обеспечение поддержки «день-в-день» (day-one support) для популярных фреймворков: llama.cpp, MLX-VLM и SGLang. Это позволяет разработчикам сразу же интегрировать модель в свои проекты без необходимости написания кастомных адаптеров. Тестирование проводилось как на устройствах (on-device), так и на серверных GPU, с использованием блока DSpark размером 8. Оценка выполнялась на шести разнообразных визуальных задачах, включая общий VQA (вопросы по изображениям), текстовый VQA, описание изображений, анализ графиков, сложное логическое рассуждение и многооборотные диалоги, согласно бенчмарку MMSpec.

Инференс на устройствах (On-Device)

Для мобильных и портативных устройств результаты впечатляют. На чипе Apple M5 Max с использованием фреймворка MLX, скорость декодирования увеличилась от 2.30x до 3.13x в зависимости от задачи. Полная задержка (end-to-end latency) улучшилась на 1.56x – 2.62x. Это означает, что приложения, работающие на MacBook Pro или iPad Pro, станут значительно отзывчивее при обработке сложных визуальных запросов.

На более старом, но все еще мощном чипе Apple M3 Ultra с использованием llama.cpp, прирост скорости декодирования составил от 1.57x до 2.14x, а общая задержка улучшилась на 1.30x – 1.77x. Хотя прирост менее выражен, чем на M5 Max, он все равно существенен для улучшения UX.

Инференс на GPU (Datacenter)

На серверном уровне, в частности на GPU NVIDIA H100, модель демонстрирует скорость декодирования от 2.04x до 2.66x быстрее базового варианта. Полная задержка улучшилась на 1.64x – 2.27x. Эти цифры делают LFM2.5-VL-DSpark привлекательным выбором для высоконагруженных сервисов, где стоимость вычислений и время отклика критичны для бизнеса.

Примеры задач, на которых тестировалась модель: VQA, описание изображений, анализ графиков.
Примеры задач, на которых тестировалась модель: VQA, описание изображений, анализ графиков.

04Огранижения спекулятивного декодирования для визуальных задач

Несмотря на впечатляющие цифры, важно понимать физические ограничения технологии. В больших языковых моделях (LLM) этап префилла (prefill) в основном ограничен вычислительной мощностью (compute-bound), и его стоимость растет субквадратично с длиной промпта. Однако в мультимодальных моделях (VLM) ситуация сложнее: изображение сначала проходит через визуальный энкодер, а затем языковая основа обрабатывает сотни визуальных токенов вместе с текстовым промптом.

На edge-устройствах вычислительная мощность значительно ниже, чем в дата-центрах. Следовательно, этап префилла занимает большую долю общего времени выполнения. Измерения времени до первого токена (time-to-first-token) и декодирования на Apple Silicon и H100 показывают, что визуальный энкодинг и префилл становятся доминирующими факторами задержки. Спекулятивное декодирование ускоряет только этап декодирования, но не визуальный энкодинг и не префилл.

Это классический закон Амдала (Amdahl's Law): общее ускорение системы ограничено частью задачи, которая не может быть ускорена. Если визуальный энкодер занимает 50% времени, то даже бесконечное ускорение декодирования даст максимум двукратное улучшение общего времени. Однако, как показывают результаты LiquidAI, на современных чипах, таких как M5 Max, где пер-ядерные GPU-нейронные ускорители сужают этот разрыв, эффект от ускорения декодирования становится максимально заметным.

⚠️ Важно
Понимание задержки. Если ваша задача требует мгновенной реакции на загрузку изображения (например, в реальном времени), оптимизация визуального энкодера может быть более приоритетной, чем спекулятивное декодирование. Однако для задач, где важна скорость генерации ответа после загрузки изображения, DSpark дает огромный буст.

05Как использовать LFM2.5-VL-DSpark: Практическое руководство

Интеграция модели в ваши проекты максимально упрощена благодаря поддержке популярных фреймворков. Ниже приведены примеры команд для запуска с использованием SGLang, llama.cpp и MLX-VLM.

Запуск через SGLang

Для использования SGLang требуется сборка с поддержкой DSpark для целей LFM2 (Pull Request #40651). Запуск целевой модели с прикрепленным черновиком выглядит следующим образом:

terminalbash
python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-VL-3B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
  --speculative-draft-attention-backend flashinfer \
  --speculative-dspark-block-size 9 \
  --disable-radix-cache

После запуска вы можете обращаться к OpenAI-совместимому эндпоинту по адресу http://localhost:30000/v1. Размер блока считывается из файла config.json черновой модели. Базовый запуск (без спекулятивного декодирования) выполняется той же командой, но без трех флагов --speculative-*.

Запуск через llama.cpp

Для llama.cpp необходима соответствующая сборка (Pull Request #29339). Пример команды:

terminalbash
llama-server -m models/LFM2.5-VL-3B-F16.gguf \
  --mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
  -md LFM2.5-2.6B-DSpark-F16.gguf \
  --spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0 \
  -fa on -ngl 99 -c 8192

Запуск через MLX-VLM

Для MLX-VLM также требуется специфическая сборка (Pull Request #2280). Команда запуска:

terminalbash
mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark

В MLX размер блока считывается из метаданных сайд-кара (параметр n-max ограничивается этим значением). Важно отметить, что спекулятивное декодирование является точным (exact): целевая модель проверяет каждый предложенный токен. Это гарантирует, что жадный вывод (greedy output) будет идентичен выводу только целевой модели. Тайминги для каждого ответа включают метрики draft_n и draft_n_accepted, что позволяет точно оценивать эффективность черновика.

📌 Факт
Доступность. Модель доступна на Hugging Face в форматах Safetensors и GGUF. Это позволяет легко интегрировать её в различные экосистемы, от локальных серверов до мобильных приложений.

06Что это значит на практике

Релиз LFM2.5-VL-DSpark знаменует собой важный шаг в демократизации мощных мультимодальных ИИ-моделей. Для разработчиков в России и других странах, где доступ к облачным API может быть ограничен или дорог, возможность запуска 3-миллиардной модели с ускорением до 3x на локальном оборудовании (например, на MacBook M-серии или даже на средних GPU) открывает новые возможности для создания коммерческих продуктов.

Представьте себе приложение для анализа медицинских снимков, которое работает локально на планшете врача, обеспечивая мгновенные ответы без задержек сети. Или интеллектуальный ассистент для работы с графиками и диаграммами, который не заставляет пользователя ждать генерации ответа. Благодаря открытой лицензии и поддержке популярных фреймворков, LiquidAI предоставляет не просто модель, а готовый инструмент для внедрения.

Технология DSpark доказывает, что оптимизация инференса не всегда требует компромиссов в качестве. Прирост в 8.9% к размеру модели — это ничтожная плата за трехкратное ускорение. Мы рекомендуем всем, кто работает с мультимодальными задачами, протестировать эту модель, особенно если вы используете Apple Silicon или NVIDIA H100. Это один из тех случаев, когда простая настройка параметров может дать мгновенный и заметный результат.

Источник: Hugging Face ↗