В мире искусственного интеллекта, где каждый бит вычислительной мощности на счету, скорость генерации текста (декодирование) часто становится узким местом. Особенно это касается мультимодальных моделей, таких как Vision-Language Models (VLM), которые должны не только «понимать» изображения, но и генерировать сложные текстовые ответы. Компания Liquid AI только что сделала значительный шаг вперед в решении этой проблемы, анонсировав LFM2.5-VL-3B-DSpark. Это не просто новая версия модели, а экспериментальный «черновик» (draft model), использующий технологию специкулятивного декодирования, который позволяет ускорить процесс генерации текста без изменения итогового вывода основной модели.
Результаты тестирования впечатляют: команда Liquid AI сообщает об ускорении декодирования в разы на чипах Apple Silicon (M5 Max) и в разы на серверных GPU NVIDIA H100. При этом важно отметить, что архитектура DSpark добавляет заметное количество параметров к базовой модели, что является минимальной ценой за столь существенный прирост производительности. В этой статье мы подробно разберем, как работает эта технология, какие архитектурные решения были приняты, как запустить модель в продакшене и какие ограничения существуют у данного подхода.
01Что такое специкулятивное декодирование и почему оно важно для VLM?
Чтобы понять революционность подхода Liquid AI, нужно сначала разобраться в базовом принципе работы больших языковых моделей (LLM) и мультимодальных моделей (VLM). В стандартном режиме генерации модель создает текст токен за токеном. На каждом шаге происходит один полный проход (forward pass) через всю нейронную сеть, что требует значительных вычислительных ресурсов и времени. Если вы генерируете длинный ответ, это может занять много секунд или даже минут, особенно на ресурсоемких устройствах.
Специкулятивное декодирование (Speculative Decoding) меняет эту парадигму. Вместо того чтобы генерировать один токен за раз, в систему добавляется небольшая, быстрая модель-«черновик» (drafter). Эта модель предлагает сразу несколько токенов вперед. Затем основная, большая целевая модель (target model) проверяет весь этот блок токенов за один проход. Если целевая модель согласна с предложенными токенами, они принимаются. Если нет — они отбрасываются, и процесс повторяется. Это позволяет пропускать несколько токенов за один вычислительный цикл основной модели, что радикально увеличивает скорость.
Ключевой инновацией Liquid AI в проекте DSpark является то, что модальность данных не имеет значения для черновика. К моменту, когда текстовые и визуальные данные достигают скрытых слоев (hidden layers) модели, они представляют собой просто тензоры. Поэтому Liquid AI смогла переиспользовать алгоритм инференса, который ранее применялся для своих текстовых моделей, для работы с мультимодальными задачами. Это упрощает интеграцию и снижает затраты на разработку специализированных компонентов для каждого типа данных.

02Архитектура и обучение DSpark: Минимализм с умом
Архитектура черновика DSpark спроектирована с упором на эффективность. Это упрощенная модель, основанная исключительно на механизме внимания (attention-only model). Команда Liquid AI провела обширные абляционные исследования (ablations), чтобы определить оптимальную конфигурацию. В результате было выбрано несколько слоев и размер блока (block size) равный несколько токенов. Однако для инференса на различных аппаратных платформах рекомендуются разные значения: для Apple Silicon оптимален блок размером 8, а для других систем — 9.
Давайте посмотрим на распределение параметров в черновике DSpark. Важно отметить, что эмбеддинги и заголовок языковой модели (LM head) связаны с целевой моделью, поэтому черновик не несет их весов, что экономит память.
Component Parameters
Decoder stack (4 layers) 193.0M
Hidden-state projection 21.0M
Markov head 65.5M
Norms + confidence head 6.4k
Total 279.5MОбщее количество добавленных параметров составляет 279.5 миллионов, что увеличивает общий размер развертываемой модели всего на 8.9%. Это крайне выгодное соотношение: незначительное увеличение объема памяти дает кратный прирост скорости.
Обучение черновика проводилось с использованием данных супервизорного тонкой настройки (SFT), охватывающих распространенные задачи компьютерного зрения и обработки естественного языка. Процесс обучения длился 10 эпох. Примечательно, что все абляционные исследования и обучение проводились исключительно на аппаратном обеспечении AMD, что демонстрирует кросс-платформенную совместимость и эффективность подхода даже на не-NVIDIA оборудовании.

03Результаты бенчмарков: Реальные цифры скорости
Оценка производительности LFM2.5-VL-3B-DSpark проводилась с использованием бенчмарка MMSpec, который охватывает 6 ключевых типов задач:
- Общий VQA (General VQA)
- VQA с текстом на изображении (Text VQA)
- Описание изображений (Image Captioning)
- VQA с графиками (Chart VQA)
- Сложное логическое мышление (Complex Reasoning)
- Многооборотные диалоги (Multi-turn Conversation)
Все тесты проводились с размером батча 1, температурой 0 и 16-битными весами для визуального энкодера и основной модели. Данные собирались на инфраструктуре Pipette — публичной системе бенчмаркинга Liquid AI.
Источник: MarkTechPost ↗
