Суть: Модель-решатель вместо генератора текста
AWS Strands Labs представила Strands Decider 2B (версия v19), относящуюся к новому классу «Decision Models» (или System One). В отличие от LLM, эта модель не пишет тексты. Она принимает состояние системы и типизированный вопрос, после чего возвращает строго структурированный ответ: выбор одного из N вариантов, вероятность ответа «да/нет» или оценку по шкале, всегда с калиброванной уверенностью.
Архитектурно модель базируется на Qwen3.5-2B-Base, у которой удалена стандартная языковая голова. Вместо неё установлена легковесная «указательная» голова (~1 млн параметров), которая за один проход (forward pass) сравнивает скрытое состояние токена
Производительность и метрики
Модель оптимизирована для локального развертывания на CPU, потребительских GPU (NVIDIA) или Apple Silicon. Ключевые показатели на бенчмарке JevBench (v1) и задержках:
| Метрика / Параметр | Значение / Характеристика |
|---|---|
| Количество параметров | 1.9 млрд |
| Точность на JevBench (v1) | 0.723 (167 из 231 задач) |
| Задержка (RTX 3090) | 115 мс (медиана), 299 мс (p95) |
| Задержка (M3 Pro) | 153 мс (медиана, <300 токенов) |
| Калибровка (ECE) | 0.052 (высокая надежность при уверенности >0.9) |
| Лицензия | Apache-2.0 (открытые веса, код, данные) |
Сравнение с конкурентами
Strands Decider конкурирует с другими моделями класса Jev, такими как Jev от TypeSafe AI и decider-2b от Mapika. Ниже приведено сравнение ключевых характеристик:
| Характеристика | Strands Decider 2B (v19) | Jev 1.13.0 (TypeSafe) | decider-2b (Mapika) |
|---|---|---|---|
| Разработчик | Strands Agents (AWS) | TypeSafe AI | Mapika |
| Доступ | Open weights (Apache-2.0) | Закрытое API | Open code/weights |
| Базовая модель | Qwen3.5-2B-Base + LoRA | Не раскрыто | Qwen3.5-2B-Base + readout |
| Точность JevBench | 0.723 | Не в таблице | 0.710 |
| Локальный хостинг | Да | Нет | Да |
Практическое применение
Модель предназначена для задач маршрутизации, выбора инструментов, проверки аргументов и создания «защитных барьеров» (guardrails) в агентах. Например, в гибридном агенте LLM может решать сложные задачи, а Strands Decider — рутинные. В примере с вызовом инструмента погоды модель проверяет, обоснованы ли аргументы пользователя и не слишком ли рано делать вызов, предотвращая ошибки агента.
Установка доступна через pip install strands-decider. Веса размещены на Hugging Face. Важно отметить: встроенный HTTP-сервер привязан к localhost без аутентификации, поэтому для продакшена требуется собственный слой защиты.
Бенчмарки
| Бенчмарк | Strands Decider 2B | Decision 2B | decider-2b |
|---|---|---|---|
| JevBench | 72.3% | 71% | 75.3% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
