Революция в скорости: один проход вместо генерации
Компания LiquidAI представила две новые open-weight модели семейства d1 decision models: d1-3B и экспериментальную d1-omni-600M. Ключевое отличие от традиционных LLM заключается в архитектуре: эти модели не генерируют токены по одному, а выдают структурированное решение за один прямой проход (single forward pass). Это делает их идеальными для задач, требующих мгновенного принятия решений в реальном времени, особенно на edge-устройствах.
Лидер бенчмарков Decision Index
Модель d1-3B заняла первое место в рейтинге Decision Index 0.2.1 среди моделей с количеством параметров менее 10B. Она превзошла как модели своего класса (4B, 9B), так и более крупную Decider 35B-A3B (47.11 балла). d1-3B поддерживает работу с текстом и изображениями, в то время как d1-omni-600M (на базе энкодера LFM2.5-Encoder-350M) добавляет поддержку аудио, но пока находится в стадии раннего исследования.
Производительность на edge-устройствах NVIDIA
В коллаборации с NVIDIA была проведена оценка скорости инференса. d1-3B демонстрирует рекордные показатели на мобильных GPU NVIDIA Jetson. На устройстве Jetson AGX Thor модель отвечает на вопрос всего за 16 мс, что позволяет обрабатывать до 262 запросов в секунду. Даже на более слабом Jetson Orin Nano время ответа составляет 50 мс.
| Устройство | 1 вопрос (мс) | 3 вопроса (мс) | 3.4K токенов состояния (мс) | 384px изображение (мс) | Пропускная способность (запрос/с) |
|---|---|---|---|---|---|
| Jetson AGX Thor | 16 | 20 | 220 | 35 | 262 |
| Jetson AGX Orin 64 GB | 26 | 35 | 560 | 83 | 110 |
| Jetson Orin Nano | 50 | 73 | 1,640 | 202 | 38 |
| Apple M5 Pro | 30 | 41 | 640 | 62 | 78 |
Результаты на публичных датасетах
Модели были протестированы на семи публичных датасетах, охватывающих чтение, классификацию намерений, медицинский QA и кросс-лингвистическое понимание. d1-3B показала средний балл 82.9, что выше, чем у Decider 4B (81.1). d1-omni-600M, имея в 4 раза меньше параметров, чем Decider 2B, также показала лучшие результаты (78.4 против 77.1).
| Бенчмарк | d1-omni-600M | d1-3B | Decider 2B | Decider 4B |
|---|---|---|---|---|
| SQuAD 2.0 | 74.0 | 83.3 | 67.7 | 76.0 |
| Civil Comments | 95.8 | 93.3 | 93.6 | 92.8 |
| MASSIVE intent | 86.1 | 86.9 | 81.1 | 88.3 |
| PubMedQA | 61.3 | 68.3 | 65.7 | 63.3 |
| BoolQ | 77.7 | 86.3 | 87.3 | 89.0 |
| XNLI | 74.7 | 85.6 | 85.0 | 88.6 |
| PAWS-X | 79.5 | 76.4 | 59.5 | 69.8 |
| Mean | 78.4 | 82.9 | 77.1 | 81.1 |
Как использовать
Модели доступны на Hugging Face. Для работы требуется библиотека transformers>=5.14. Загрузка осуществляется с флагом trust_remote_code=True. Архитектура позволяет обрабатывать батчи запросов без паддинга, что критично для высокой пропускной способности в продакшене. d1-3B загружается как AutoModel.from_pretrained("LiquidAI/d1-3B").
Бенчмарки
| Бенчмарк | d1-3B | Decider 2B | Decider 35B-A3B | Decider 4B | d1-omni-600M |
|---|---|---|---|---|---|
| Decision Index 0.2.1 | 48.57% | — | 47.11% | — | — |
| SQuAD 2.0 | 83.3% | 67.7% | — | 76% | 74% |
| Civil Comments | 93.3% | 93.6% | — | 92.8% | 95.8% |
| MASSIVE intent | 86.9% | 81.1% | — | 88.3% | 86.1% |
| PubMedQA | 68.3% | 65.7% | — | 63.3% | 61.3% |
| BoolQ | 86.3% | 87.3% | — | 89% | 77.7% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Hugging Face blog ↗
