Релиз модели7 октября 2026 г., 23:18 МСК🤖 Auto

Liquid AI выпустила d1: модели-решения с нулевым выводом токенов

Liquid AI открыла веса мультимодальных моделей d1-3B и d1-omni-600M, которые принимают решения за один проход без генерации текста. Это прорыв для роутинга, модерации и edge-устройств.

Баннер новости 9148

Что такое Decision Model и почему это важно

В отличие от традиционных LLM, которые генерируют ответ токен за токеном, Decision Model (модель принятия решений) от Liquid AI работает иначе. Она принимает состояние и набор вопросов, а затем возвращает калиброванные вероятности для каждого из возможных ответов за один прямой проход (one forward pass). Ключевая метрика — output_tokens: 0. Это исключает необходимость парсинга текста и снижает задержки, делая модели идеальными для систем реального времени.

Модели поддерживают три типа вопросов:

  • noul: вопрос «да/нет» с выдачей P(yes).
  • choice: выбор одной метки из списка с полным распределением вероятностей.
  • score: оценка по шкале от 2 до 10 уровней с вероятностным взвешиванием.

Характеристики моделей d1-3B и d1-omni-600M

Компания представила две модели, оптимизированные под разные задачи. d1-3B фокусируется на тексте и изображениях, а d1-omni-600M добавляет поддержку аудио. Обе модели не являются чат-ботами и не генерируют свободный текст.

Параметр d1-3B d1-omni-600M
Количество параметров 3.12B 587M
Базовая архитектура LFM2.5-VL-3B (Decoder-only) LFM2.5-Encoder-350M (Bidirectional)
Входные данные Текст + Изображения Текст + (Изображения ИЛИ Аудио)
Контекстное окно 32,768 токенов 16,384 токенов
Визуальный энкодер SigLIP2 NaFlex (400M) 381M shared trunk
Аудио энкодер Не применимо FastConformer (17 слоев, до 30 сек)

Производительность и бенчмарки

На внутреннем бенчмарке Decision Index v0.2.1 модель d1-3B набрала 48.57 балла. Это лучший результат среди моделей с количеством параметров менее 10B, обогнав Decider 35B-A3B (47.11). Единственной моделью с более высоким показателем стала Winnow-12B (50.02). d1-3B также лидирует в категориях Tools (74.5) и Arts (36.3).

В текстовых бенчмарках d1-3B показала среднее значение 82.9, что выше, чем у Decider 4B (81.1). Модель d1-omni-600M набрала в среднем 78.4, достигнув пика в 95.8 на Civil Comments.

Скорость работы на NVIDIA и Jetson

Liquid AI опубликовала данные по латентности (end-to-end latency) для d1-3B. При использовании model.compile(mode="reduce-overhead") на RTX 4090 ответ на один вопрос занимает всего 8 мс. На AMD MI325X это 9 мс. Для edge-устройств результаты также впечатляющие: 16 мс на Jetson AGX Thor, 26 мс на AGX Orin и 50 мс на Orin Nano. На Jetson AGX Thor обработка трех вопросов через одно состояние занимает 20 мс.

Лицензирование и запуск

Модели доступны на Hugging Face с поддержкой Transformers и llama.cpp. Лицензия LFM Open License v1.0 разрешает бесплатное коммерческое использование для компаний с годовой выручкой до $10 миллионов. Для запуска требуется transformers версии >=5.14 (для d1-3B) и >=5.15 (для d1-omni-600M). Liquid AI рекомендует использовать float16 для d1-omni-600M на GPU, так как bfloat16 может влиять на точность топ-ответов.

Бенчмарки

Бенчмаркd1-3BDecider 35B-A3BDecider 4BWinnow-12B
Decision Index v0.2.148.57%47.11%40.7%50.02%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗