Что такое Decision Model и почему это важно
В отличие от традиционных LLM, которые генерируют ответ токен за токеном, Decision Model (модель принятия решений) от Liquid AI работает иначе. Она принимает состояние и набор вопросов, а затем возвращает калиброванные вероятности для каждого из возможных ответов за один прямой проход (one forward pass). Ключевая метрика — output_tokens: 0. Это исключает необходимость парсинга текста и снижает задержки, делая модели идеальными для систем реального времени.
Модели поддерживают три типа вопросов:
- noul: вопрос «да/нет» с выдачей P(yes).
- choice: выбор одной метки из списка с полным распределением вероятностей.
- score: оценка по шкале от 2 до 10 уровней с вероятностным взвешиванием.
Характеристики моделей d1-3B и d1-omni-600M
Компания представила две модели, оптимизированные под разные задачи. d1-3B фокусируется на тексте и изображениях, а d1-omni-600M добавляет поддержку аудио. Обе модели не являются чат-ботами и не генерируют свободный текст.
| Параметр | d1-3B | d1-omni-600M |
|---|---|---|
| Количество параметров | 3.12B | 587M |
| Базовая архитектура | LFM2.5-VL-3B (Decoder-only) | LFM2.5-Encoder-350M (Bidirectional) |
| Входные данные | Текст + Изображения | Текст + (Изображения ИЛИ Аудио) |
| Контекстное окно | 32,768 токенов | 16,384 токенов |
| Визуальный энкодер | SigLIP2 NaFlex (400M) | 381M shared trunk |
| Аудио энкодер | Не применимо | FastConformer (17 слоев, до 30 сек) |
Производительность и бенчмарки
На внутреннем бенчмарке Decision Index v0.2.1 модель d1-3B набрала 48.57 балла. Это лучший результат среди моделей с количеством параметров менее 10B, обогнав Decider 35B-A3B (47.11). Единственной моделью с более высоким показателем стала Winnow-12B (50.02). d1-3B также лидирует в категориях Tools (74.5) и Arts (36.3).
В текстовых бенчмарках d1-3B показала среднее значение 82.9, что выше, чем у Decider 4B (81.1). Модель d1-omni-600M набрала в среднем 78.4, достигнув пика в 95.8 на Civil Comments.
Скорость работы на NVIDIA и Jetson
Liquid AI опубликовала данные по латентности (end-to-end latency) для d1-3B. При использовании model.compile(mode="reduce-overhead") на RTX 4090 ответ на один вопрос занимает всего 8 мс. На AMD MI325X это 9 мс. Для edge-устройств результаты также впечатляющие: 16 мс на Jetson AGX Thor, 26 мс на AGX Orin и 50 мс на Orin Nano. На Jetson AGX Thor обработка трех вопросов через одно состояние занимает 20 мс.
Лицензирование и запуск
Модели доступны на Hugging Face с поддержкой Transformers и llama.cpp. Лицензия LFM Open License v1.0 разрешает бесплатное коммерческое использование для компаний с годовой выручкой до $10 миллионов. Для запуска требуется transformers версии >=5.14 (для d1-3B) и >=5.15 (для d1-omni-600M). Liquid AI рекомендует использовать float16 для d1-omni-600M на GPU, так как bfloat16 может влиять на точность топ-ответов.
Бенчмарки
| Бенчмарк | d1-3B | Decider 35B-A3B | Decider 4B | Winnow-12B |
|---|---|---|---|---|
| Decision Index v0.2.1 | 48.57% | 47.11% | 40.7% | 50.02% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
