Релиз модели26 сентября 2026 г., 02:17 МСК🤖 Auto

Liquid AI выпустила DSpark: ускорение VLM до 3.13x без потери качества

Liquid AI представила экспериментальную модель-черновик LFM2.5-VL-3B-DSpark, которая ускоряет генерацию текстовых ответов в мультимодальных моделях до 3.13 раз на Apple Silicon и 2.66x на NVIDIA H100.

Баннер новости 8309

Суть инновации: Speculative Decoding для мультимодальности

Компания Liquid AI выпустила LFM2.5-VL-3B-DSpark — специализированную модель-черновик (draft model) для своей базовой VLM LFM2.5-VL-3B. Технология использует speculative decoding: маленький черновик предсказывает несколько токенов вперед, а основная модель проверяет их за один проход. Ключевое преимущество DSpark в том, что на уровне скрытых состояний (hidden states) текст и изображения становятся просто тензорами, что позволяет использовать один и тот же алгоритм инференса для разных модальностей без изменения выходных данных основной модели.

Архитектура и стоимость внедрения

Модель-черновик добавляет всего 280 млн параметров к базовой модели, что увеличивает общий объем развертывания на 8.9%. Архитектура оптимизирована для эффективности: она использует только слои внимания (attention-only), имеет 4 слоя и размер блока 8-9 токенов. Обучение проводилось на данных supervised fine-tuning (SFT) по 10 эпохам исключительно на оборудовании AMD.

Результаты бенчмарков: скорость против качества

Тестирование проводилось на инфраструктуре Pipette с использованием метрики MMSpec. Результаты показывают значительный прирост скорости декодирования, хотя общая скорость (end-to-end) ниже из-за неизменной скорости кодирования изображений. Ниже приведена сводка производительности:

Платформа / Стек Ускорение декодирования Общее ускорение (End-to-End) Принятые токены за проход
MLX-VLM, Apple M5 Max (блок 8) до 3.13x до 2.62x 3.24 – 4.34
llama.cpp, Apple M3 Ultra (блок 8) до 2.14x до 1.77x 3.31 – 4.50
SGLang, NVIDIA H100 80GB (блок 9) до 2.66x до 2.27x 3.46 – 4.57

На Apple Silicon (M5 Max) максимальное ускорение декодирования (3.13x) достигнуто на задаче генерации описаний COCO, тогда как общее ускорение (2.62x) зафиксировано на сложном наборе MMMU-Pro. На NVIDIA H100 при высокой конкурентности преимущество DSpark сохраняется, хотя разрыв в скорости сужается.

Лицензирование и доступность

Модель доступна на Hugging Face в форматах Safetensors и GGUF с поддержкой SGLang, MLX-VLM и llama.cpp. Лицензия LFM Open License v1.0 разрешает бесплатное коммерческое использование только для компаний с годовой выручкой менее $10 млн. Для более крупных корпораций требуется отдельное соглашение. Liquid AI отмечает, что при использовании температуры (temperature) > 0 скорость может снижаться из-за уменьшения процента принятия токенов черновиком, так как распределение вероятностей становится более размытым.

Источник: MarkTechPost ↗