В мире локальных больших языковых моделей (LLM) постоянный поиск баланса между размером модели, скоростью работы и качеством ответов является одной из самых острых проблем. Разработчики, стремящиеся запускать мощные агенты на потребительском оборудовании, часто сталкиваются с дилеммой: либо использовать огромные модели, требующие десятков гигабайт видеопамяти, либо довольствоваться сильно сжатыми версиями, которые теряют в интеллекте. Недавнее появление модели Underdog Saluki 27B от Conway Research предлагает инновационное решение этой проблемы. Это не просто еще одна квантованная версия, а специализированный инструмент, созданный для того, чтобы превратить чат-модель в эффективного агента, работающего на устройствах с ограниченными ресурсами.
Saluki 27B представляет собой 2-битную GGUF-модель на базе архитектуры Qwen3.8-27B. Ее ключевая особенность заключается в том, что она занимает всего 7.89 ГБ памяти, в то время как оригинальная модель в формате BF16 требует около 54 ГБ. При этом разработчики добились удивительного результата: модель не только сохраняет высокую точность в большинстве задач, но и превосходит оригинал в критически важном для агентов навыке — вызове инструментов (tool calling). В этой статье мы подробно разберем, как была достигнута такая эффективность, какие технические решения лежат в основе Saluki, и что это значит для разработчиков, работающих с локальным AI.
01Архитектурный фундамент: От Qwen3.8 к Saluki
Чтобы понять, как удалось сжать модель в 7 раз без катастрофической потери качества, нужно рассмотреть три уровня работы, которые были применены к базовой модели. Первым слоем является Qwen3.8-27B от команды Qwen. Это плотная модель с 27 миллиардами параметров, состоящая из 64 слоев. Архитектура Qwen3.8 интересна тем, что она сочетает в себе линейное внимание Gated DeltaNet с традиционным механизмом внимания (attention). Это позволяет модели эффективно обрабатывать контекст длиной до 262 144 токенов нативно, что является отличным фундаментом для сложных задач.
Вторым слоем стала работа ISTA-DASLab, известной своими исследованиями в области квантования. Они разработали формат Qwen3.8-27B-GSQ-RCO-GGUF. Здесь применяются две ключевые технологии: GSQ (Grid Scalar Quantization) и RCO (Rate-Controlled Optimization). GSQ учится создавать точные низкоразрядные скалярные сетки для каждого тензора, а RCO назначает тип квантования каждому тензору в рамках фиксированного бюджета размера. Результатом этой работы стал файл формата IQ2_XS размером 8.4 ГБ при 2.50 бита на вес. Это уже значительное сжатие, но Underdog пошел дальше.
Третий слой — это собственная доработка от Underdog. Они смогли уменьшить размер файла до 7.89 ГБ, используя формат IQ2-mix с тегом imatrix. Важно отметить, что Underdog не опубликовали полный рецепт этой обработки, но их цель была конкретной: защитить и улучшить навык вызова инструментов. Именно этот фокус на функциональности агентов, а не просто на сжатии, делает Saluki уникальным продуктом на рынке.
02Почему Tool Calling — это новая «битва титанов»
В эпоху агентов (Agentic AI) способность модели правильно вызывать инструменты (API, функции, поиск в интернете) стала важнее, чем просто генерация текста. Если модель может красиво написать эссе, но не может корректно вызвать функцию для получения актуальных данных, она бесполезна для реальных задач. Именно здесь Saluki 27B демонстрирует свои сильные стороны.
Разработчики провели сравнительный анализ, разделив результаты на две группы. В первой группе использовался единый бенчмарк Underdog Bench, основанный на BFCL v4 (Benchmark for Function Calling Language Models). Этот тест включает 120 задач, где модели нужно было вызвать инструменты без режима «мышления» (thinking off) и с температурой 0. Результаты оказались впечатляющими:
- Saluki 27B: 88 баллов из 100.
- Полная модель Qwen3.8-27B (BF16): 84 балла.
- PrismML Bonsai 2: 70 баллов.

Особенно стоит выделить задачу Parallel tool calls (параллельный вызов инструментов). В этом тесте Saluki выполнил 42 успешных вызова против 35 у полной модели. Это означает, что сжатая версия не просто не потеряла в этом навыке, а улучшила его на 20%. Это парадоксальный, но крайне полезный результат, который говорит о том, что квантование, если оно выполнено правильно, может даже «очистить» модель от шума, мешающего точному выбору функций.
03Сравнение с другими компактными решениями
Рынок квантованных моделей Qwen3.8-27B быстро растет, и Saluki конкурирует с несколькими сильными игроками. Давайте сравним его с основными альтернативами, чтобы понять его место в экосистеме.
PrismML Bonsai 2 является, пожалуй, самым сильным конкурентом по части общего качества. Он использует формат PTQ1_0 с 1.75 битами на вес и занимает всего 5.95 ГБ. Bonsai 2 демонстрирует 98.2% удержания качества по 14 бенчмаркам в режиме мышления и показывает отличные результаты в математике (95.00 на AIME25). Однако у него есть существенный недостаток: он требует специального форка llama.cpp от PrismML, так как стандартная версия llama.cpp не поддерживает его форматы упаковки. Это создает барьер для пользователей, которые хотят просто скачать модель и запустить её в Ollama или LM Studio.
ISTA-DASLab IQ2_XS занимает промежуточное положение. Его размер 8.4 ГБ, а битность 2.50. Он совместим со stock llama.cpp, но, согласно данным, уступает Saluki в специализированных тестах на вызов инструментов. Кроме того, ISTA не публиковала детальных результатов Underdog Bench для своего решения, что затрудняет прямое сравнение.
Saluki 27B выигрывает за счет идеального баланса: он совместим со stock llama.cpp (как и ISTA), но превосходит их в функциональности агентов (в отличие от Bonsai, который требует сложной настройки). Его размер 7.89 ГБ делает его одним из самых компактных решений, способных работать в стандартных средах без дополнительных усилий.
04Где модель теряет: Математика и сложные рассуждения
Нельзя говорить о квантовании, не упомянув о ценах, которые приходится платить. Сжатие модели до 2 бит неизбежно приводит к потере точности в задачах, требующих глубокого логического вывода и сложных вычислений. Saluki 27B не является исключением.
При сравнении с публичными результатами полной модели Qwen3.8-27B, Saluki показывает значительное отставание в математических и логических тестах:

- AIME 2025: Saluki набрал 79.2 против 96.7 у оригинала (около 82% удержания).
- AIME 2026: 80.0 против 94.6.
- MBPP+ (программирование): 78.0 против 83.9.
- MuSR (сложные рассуждения): 67.5 против 79.6.
Это означает, что если ваша задача требует решения сложных математических задач или многошагового логического анализа, Saluki может уступать полной модели на 12-18 процентных пунктов. Однако для задач, связанных с обработкой текста, генерацией кода, поиском информации и вызовом API, эта потеря часто незаметна или компенсируется скоростью работы.
Интересно, что в таких задачах, как SWE-bench Verified (решение реальных проблем в коде), Saluki исправил 30 из 50 issues, в то время как полная модель — 33. Разница минимальна, что говорит о том, что модель сохраняет способность к практическому программированию, даже будучи сильно сжатой.
05Практическое применение: Запуск локальных агентов
Для разработчиков, работающих с AI-агентами, Saluki 27B открывает новые возможности. Благодаря совместимости со stock llama.cpp, модель можно запустить в популярных интерфейсах, таких как Ollama, LM Studio или Text Generation WebUI, без необходимости компиляции специальных версий.
Представьте сценарий, где вы разрабатываете агента для поддержки клиентов. Агент должен уметь: 1. Понимать запрос пользователя. 2. Искать информацию в базе знаний (вызов инструмента поиска). 3. Форматировать ответ (вызов инструмента генерации).
С полной моделью Qwen3.8-27B вам потребуется сервер с видеокартой уровня NVIDIA A100 или несколькими RTX 4090. С Saluki 27B вы можете запустить этот агент на ноутбуке с 16 ГБ оперативной памяти (используя CPU offload) или на настольном ПК с видеокартой среднего уровня (например, RTX 3060 с 12 ГБ VRAM, где модель поместится полностью в видеопамять с запасом). Это снижает стоимость развертывания в разы.
Кроме того, Saluki поддерживает опциональные визуальные дополнения (vision add-on) размером 629 МБ или 928 МБ. Это позволяет модели не только работать с текстом, но и анализировать изображения, что расширяет спектр задач, которые может решать локальный агент.

06Что это значит на практике
Появление Underdog Saluki 27B знаменует собой сдвиг в парадигме локального AI. Раньше квантование воспринималось как компромисс: «меньше памяти = меньше ум». Saluki доказывает, что при правильном подходе можно получить «больше функциональности при меньшем размере» в специфических, но критически важных областях, таких как вызов инструментов.
Для разработчиков это означает:
- Демократизация агентов: Запуск сложных AI-агентов больше не требует дорогого оборудования. Любой энтузиаст или стартап может развернуть мощного агента на стандартном железе.
- Фокус на функциональности: При выборе модели для агентов стоит смотреть не только на общие бенчмарки (как MMLU), но и на специализированные тесты (как BFCL). Saluki показывает, что модель может быть «глупее» в математике, но «умнее» в работе с API.
- Простота развертывания: Совместимость со stock llama.cpp устраняет технические барьеры. Нет нужды искать специфические форки или настраивать сложные окружения.
Однако важно сохранять реализм. Saluki 27B — это не универсальная замена полной модели. Если ваша задача требует глубокого математического анализа или сложного логического вывода, возможно, стоит рассмотреть более крупные модели или гибридные подходы. Но для задач, где скорость, стоимость и автономность важнее абсолютной точности в математике, Saluki 27B является одним из лучших выборов на сегодняшний день.
Разработчики из Underdog проделали отличную работу, продемонстрировав, что квантование — это не просто техника сжатия, а инструмент для оптимизации поведения модели под конкретные задачи. В будущем мы, вероятно, увидим больше моделей, созданных с аналогичным фокусом на функциональности, а не просто на размере.
Если вы хотите попробовать Saluki 27B в действии, вы можете найти модель на Hugging Face. Рекомендуется начать с тестов на задачах вызова инструментов, чтобы оценить преимущества, которые она предлагает. Помните, что каждый проект уникален, и выбор модели должен зависеть от конкретных требований вашего приложения. Но в арсенале разработчика локального AI теперь есть мощный инструмент, который меняет правила игры.
Источник: MarkTechPost ↗
