Релиз модели25 сентября 2026 г., 08:16 МСК🤖 Auto

Fastino выпустил GLiNER2.5-Decide: 340M-модель для принятия решений на CPU

Fastino Labs представила GLiNER2.5-Decide — открытую модель-классификатор на 340 млн параметров, способную выполнять сложные решения (роутинг, guardrails) прямо на CPU с задержкой менее 170 мс.

Баннер новости 8238

Суть релиза: не генерация, а решение

Fastino Labs выпустила GLiNER2.5-Decide, специализированную модель для агентов ИИ. В отличие от LLM, она не генерирует текст, а работает как негенеративный классификатор на базе энкодера DeBERTa-v3-large. Модель принимает текст и схему (schema) с типизированными вопросами, возвращая структурированные ответы с распределением вероятностей, оценкой уверенности и метаданными о соблюдении ограничений.

Ключевая особенность — joint decoding (совместное декодирование). Модель учитывает правила связи между ответами. Например, если один вопрос выявляет вредоносный контент, а другой помечает его как безопасный, логическое правило принудительно вернет вердикт safety=unsafe, устраняя противоречия, которые могли бы возникнуть при независимом анализе.

Производительность и метрики

Модель протестирована на внутреннем датасете Fast Decisions (5 100 примеров, 17 наборов данных). Метрика — точное совпадение (exact-match). GLiNER2.5-Decide показала лучший результат среди сравнимых по размеру моделей, особенно в задачах роутинга намерений.

Модель Тип Средняя точность (Fast Decisions)
GLiNER2.5-Decide 340M encoder 60.1%
JevK5 4B-class Qwen3.5 decoder 57.5%
SemIf Qwen3.5-4B decoder 56.4%
GLiFormer large-v1 Single-pass encoder 49.0%
Laya 421M ModernBERT encoder 46.6%

В нише роутинга намерений модель демонстрирует отрыв: 75.3% на задачах поддержки (на 18.6 п.п. выше конкурентов) и 64.3% в банковской сфере.

Скорость работы на CPU и GPU

Модель оптимизирована для работы в условиях ограниченных ресурсов. Задержка (p50 latency) для коротких запросов (64 токена, батч 1) на серверном CPU составляет всего 167.3 мс (Intel Xeon Platinum 8581C, 48 vCPU). Это делает её пригодной для real-time обработки в агентных пайплайнах без необходимости в GPU.

Оборудование Задержка (p50, 64 токена) Задержка (p50, 1024 токена)
Intel Xeon Platinum 8581C (48 vCPU) 167.3 ms —
NVIDIA T4 43.6 ms —
NVIDIA L4 43.4 ms 131.4 ms
NVIDIA V100 38.3 ms 75.6 ms
NVIDIA A100 47.3 ms 52.6 ms

Деплой и экосистема

Веса модели распространяются под лицензией Apache 2.0, установка осуществляется через pip install gliner2. Модель поддерживает работу на CPU, GPU и в изолированных (air-gapped) средах. Fastino также предлагает хостинг через GLiNER API и инструменты для дообучения (fine-tuning) с поддержкой LoRA.

Помимо базовой версии (340M), выпущены GLiNER2.5-Decide-1B (на базе Ettin 1B, точность 59.6%) и мультиязычная версия GLiNER2.5-multi-Decide (287M, точность 56.7%).

Бенчмарки

БенчмаркGLiNER2.5-DecideGLiFormer large-v1JevK5SemIf
Fast Decisions60.1%49%57.5%56.4%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗