Суть инновации: Speculative Decoding для мультимодальности
Компания Liquid AI выпустила LFM2.5-VL-3B-DSpark — специализированную модель-черновик (draft model) для своей базовой VLM LFM2.5-VL-3B. Технология использует speculative decoding: маленький черновик предсказывает несколько токенов вперед, а основная модель проверяет их за один проход. Ключевое преимущество DSpark в том, что на уровне скрытых состояний (hidden states) текст и изображения становятся просто тензорами, что позволяет использовать один и тот же алгоритм инференса для разных модальностей без изменения выходных данных основной модели.
Архитектура и стоимость внедрения
Модель-черновик добавляет всего 280 млн параметров к базовой модели, что увеличивает общий объем развертывания на 8.9%. Архитектура оптимизирована для эффективности: она использует только слои внимания (attention-only), имеет 4 слоя и размер блока 8-9 токенов. Обучение проводилось на данных supervised fine-tuning (SFT) по 10 эпохам исключительно на оборудовании AMD.
Результаты бенчмарков: скорость против качества
Тестирование проводилось на инфраструктуре Pipette с использованием метрики MMSpec. Результаты показывают значительный прирост скорости декодирования, хотя общая скорость (end-to-end) ниже из-за неизменной скорости кодирования изображений. Ниже приведена сводка производительности:
| Платформа / Стек | Ускорение декодирования | Общее ускорение (End-to-End) | Принятые токены за проход |
|---|---|---|---|
| MLX-VLM, Apple M5 Max (блок 8) | до 3.13x | до 2.62x | 3.24 – 4.34 |
| llama.cpp, Apple M3 Ultra (блок 8) | до 2.14x | до 1.77x | 3.31 – 4.50 |
| SGLang, NVIDIA H100 80GB (блок 9) | до 2.66x | до 2.27x | 3.46 – 4.57 |
На Apple Silicon (M5 Max) максимальное ускорение декодирования (3.13x) достигнуто на задаче генерации описаний COCO, тогда как общее ускорение (2.62x) зафиксировано на сложном наборе MMMU-Pro. На NVIDIA H100 при высокой конкурентности преимущество DSpark сохраняется, хотя разрыв в скорости сужается.
Лицензирование и доступность
Модель доступна на Hugging Face в форматах Safetensors и GGUF с поддержкой SGLang, MLX-VLM и llama.cpp. Лицензия LFM Open License v1.0 разрешает бесплатное коммерческое использование только для компаний с годовой выручкой менее $10 млн. Для более крупных корпораций требуется отдельное соглашение. Liquid AI отмечает, что при использовании температуры (temperature) > 0 скорость может снижаться из-за уменьшения процента принятия токенов черновиком, так как распределение вероятностей становится более размытым.
Источник: MarkTechPost ↗
