В эпоху, когда большинство разработчиков искусственного интеллекта гонится за увеличением параметров и вычислительной мощности, Fastino Labs предлагает альтернативный, прагматичный подход. Компания выпустила GLiNER2.5-Decide — модель с 340 миллионами параметров, предназначенную не для генерации текста, а для принятия решений. Это не просто классификатор, а специализированный инструмент для агентных систем, который обрабатывает текст и схему вопросов, возвращая структурированные ответы с распределением вероятностей, оценкой уверенности и метаданными о соблюдении ограничений. В этой статье мы подробно разберем, как эта технология меняет правила игры в области маршрутизации, триажа и обеспечения безопасности в конвейерах AI-агентов.
GLiNER2.5-Decide нацелена на решение частых задач принятия решений внутри агентных конвейеров: маршрутизация запросов, первичный анализ (триаж), выбор инструментов и настройка защитных механизмов (guardrails). Важно отметить, что модель работает не только на мощных GPU, но и на обычных процессорах (CPU), что делает её доступной для широкого круга разработчиков, включая тех, кто работает в условиях ограниченных ресурсов или требует полной изоляции данных (air-gapped environments). Веса модели распространяются под лицензией Apache 2.0, что позволяет свободно использовать их в коммерческих и исследовательских проектах.
01Что такое GLiNER2.5-Decide и как она работает?
GLiNER2.5-Decide — это негенеративный классификатор. В отличие от больших языковых моделей (LLM), которые генерируют токены по одному, эта модель использует архитектуру DeBERTa-v3-large и была дообучена на базе модели gliner2-large-v1. Ключевое отличие заключается в том, что она не создает новый текст и не требует сложных промпт-шаблонов. Вместо этого она фокусируется на извлечении смысла и принятии бинарных или множественных решений на основе заданной схемы.
Работа модели строится на двух этапах. На первом этапе энкодер обрабатывает входной текст и схему вопросов одновременно, оценивая каждое разрешенное значение. На втором этапе используется ограниченный декодер (constrained decoder), который ищет наилучшее совместное назначение ответов, учитывая правила, заявленные в схеме. Это позволяет модели учитывать контекст и взаимосвязи между различными вопросами, а не обрабатывать их изолированно.
Fastino четко определяет границы применимости модели: GLiNER2.5-Decide не рассуждает, не объясняет свои выводы и не отвечает на открытые вопросы. Это специалист по операционным решениям. Если вам нужно понять, куда направить запрос пользователя или является ли текст опасным, эта модель справится с задачей заметно быстрее и эффективнее, чем общая LLM.

02Почему совместное декодирование (Joint Decoding) имеет значение?
Одной из самых сильных сторон GLiNER2.5-Decide является механизм совместного декодирования. Чтобы понять его ценность, рассмотрим пример с защитой от атак (guardrails). Представьте, что модель анализирует пользовательский запрос. При независимом декодировании она может отметить наличие инъекции промпта с высокой вероятностью, но одновременно классифицировать тот же запрос как безопасный с умеренной вероятностью. Это создает конфликт: атака обнаружена, но вывод противоречив.
Совместное декодирование решает эту проблему, применяя правила, которые связывают ответы. Например, правило может гласить: «Если обнаружена вредоносная активность, вердикт должен быть "unsafe"». В результате модель возвращает согласованный набор данных: safety=unsafe и harm_type=prompt_injection. Это позволяет downstream-коду (последующим компонентам системы) принимать четкие решения: заблокировать запрос, перенаправить его или эскалировать.
Схемы могут выражать сложные логические связи: импликации, исключения, ограничения на количество ответов (cardinality) и порядковые границы. При этом тот же энкодер может извлекать сущности, отношения и структурированные записи с указанием символьных смещений за один проход. Однако стоит отметить, что ответы классификации не возвращают цитаты (evidence spans), подтверждающие вывод.
03Результаты бенчмарков: скорость и точность
Fastino оценила модель на внутреннем наборе данных Fast Decisions, который содержит несколько тысяч тестовых примеров из 17 различных датасетов. Задачи охватывают операции с клиентами, маршрутизацию в таких доменах, как банкинг, клиническая медицина, путешествия и льготы, а также общее понимание контента. Метрика точности — exact-match: предсказывается только если набор меток полностью совпадает с эталонным.

Результаты выглядят впечатляюще для модели такого размера:
- GLiNER2.5-Decide (340M encoder): 60.1% средняя точность.
- JevK5 (4B-class Qwen3.5 decoder): 57.5%.
- SemIf (Qwen3.5-4B decoder): 56.4%.
- GLiFormer large-v1 (Single-pass encoder): 49.0%.
- Laya (421M ModernBERT encoder): 46.6%.
GLiNER2.5-Decide лидировала в большинстве датасетов. Особенно сильна модель в маршрутизации намерений (intent routing). На задаче поддержки клиентов она показала значительный результат, а в банковском секторе — уверенные показатели. Эти значения заметно выше, чем у лучших моделей-конкурентов.
Источник: MarkTechPost ↗
