Суть релиза: не генерация, а решение
Fastino Labs выпустила GLiNER2.5-Decide, специализированную модель для агентов ИИ. В отличие от LLM, она не генерирует текст, а работает как негенеративный классификатор на базе энкодера DeBERTa-v3-large. Модель принимает текст и схему (schema) с типизированными вопросами, возвращая структурированные ответы с распределением вероятностей, оценкой уверенности и метаданными о соблюдении ограничений.
Ключевая особенность — joint decoding (совместное декодирование). Модель учитывает правила связи между ответами. Например, если один вопрос выявляет вредоносный контент, а другой помечает его как безопасный, логическое правило принудительно вернет вердикт safety=unsafe, устраняя противоречия, которые могли бы возникнуть при независимом анализе.
Производительность и метрики
Модель протестирована на внутреннем датасете Fast Decisions (5 100 примеров, 17 наборов данных). Метрика — точное совпадение (exact-match). GLiNER2.5-Decide показала лучший результат среди сравнимых по размеру моделей, особенно в задачах роутинга намерений.
| Модель | Тип | Средняя точность (Fast Decisions) |
|---|---|---|
| GLiNER2.5-Decide | 340M encoder | 60.1% |
| JevK5 | 4B-class Qwen3.5 decoder | 57.5% |
| SemIf | Qwen3.5-4B decoder | 56.4% |
| GLiFormer large-v1 | Single-pass encoder | 49.0% |
| Laya | 421M ModernBERT encoder | 46.6% |
В нише роутинга намерений модель демонстрирует отрыв: 75.3% на задачах поддержки (на 18.6 п.п. выше конкурентов) и 64.3% в банковской сфере.
Скорость работы на CPU и GPU
Модель оптимизирована для работы в условиях ограниченных ресурсов. Задержка (p50 latency) для коротких запросов (64 токена, батч 1) на серверном CPU составляет всего 167.3 мс (Intel Xeon Platinum 8581C, 48 vCPU). Это делает её пригодной для real-time обработки в агентных пайплайнах без необходимости в GPU.
| Оборудование | Задержка (p50, 64 токена) | Задержка (p50, 1024 токена) |
|---|---|---|
| Intel Xeon Platinum 8581C (48 vCPU) | 167.3 ms | — |
| NVIDIA T4 | 43.6 ms | — |
| NVIDIA L4 | 43.4 ms | 131.4 ms |
| NVIDIA V100 | 38.3 ms | 75.6 ms |
| NVIDIA A100 | 47.3 ms | 52.6 ms |
Деплой и экосистема
Веса модели распространяются под лицензией Apache 2.0, установка осуществляется через pip install gliner2. Модель поддерживает работу на CPU, GPU и в изолированных (air-gapped) средах. Fastino также предлагает хостинг через GLiNER API и инструменты для дообучения (fine-tuning) с поддержкой LoRA.
Помимо базовой версии (340M), выпущены GLiNER2.5-Decide-1B (на базе Ettin 1B, точность 59.6%) и мультиязычная версия GLiNER2.5-multi-Decide (287M, точность 56.7%).
Бенчмарки
| Бенчмарк | GLiNER2.5-Decide | GLiFormer large-v1 | JevK5 | SemIf |
|---|---|---|---|---|
| Fast Decisions | 60.1% | 49% | 57.5% | 56.4% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
