Исследования2 октября 2026 г., 07:18 МСК🤖 Auto

SLM-разрыв: Почему квантованные модели не справляются с микрозадачами агентов

Исследование показывает, что даже современные SLM (Qwen3, Llama-3.x) не проходят пороговые метрики для автономных задач, а 4-битное квантование лишь усугубляет проблему.

Баннер новости 8752

Суть проблемы: «Разрыв пригодности» (Eligibility Gap)

Исследователи Jundong Hu и Shekar Ramachandran из arXiv (2026) провели строгий аудит использования Small Language Models (SLM) в качестве «рабочих лошадок» для агентов. В то время как крупные LLM выступают в роли планировщиков, SLM должны выполнять рутинные микрозадачи: авто-одобрение команд, запись в память, ранжирование диалогов и выбор инструментов. Авторы ввели понятие «разрыва пригодности» — ситуации, когда модель формально способна выполнить задачу, но не достигает заданного практиком порога надежности (threshold τ).

Методология и бенчмарк

Для проверки был создан бенчмарк из 4 микрозадач с фиксированными промптами и автоматическими метриками. Ключевая особенность теста — использование доверительных интервалов (CI): конфигурация считается годной только если нижняя граница доверительного интервала превышает порог τ, установленный на основе дешевых не-LLM базовых решений (например, BM25). Тестировались модели Qwen3 (0.6B, 1.7B, 4B, 8B) в режиме FP16, greedy-декодинга, без дообучения.

Результаты: 0 из 16 прошли тест

Результаты оказались категоричными: ни одна из 16 протестированных конфигураций (4 модели × 4 задачи) не прошла порог пригодности. Даже при проверке сырых выводов и поведения парсеров не было найдено ни одного успешного кейса. Это доказывает, что «out-of-the-box» SLM пока недостаточны для надежной автоматизации микрозадач без тонкой настройки или гибридных схем.

Модель / Конфигурация Размер Точность (прибл.) Прошел порог τ? Влияние 4-bit квантования
Qwen3 0.6B - 8B Ниже порога Нет (0/16) Ухудшает результат, не меняя статус
Llama-3.x 12B Ниже порога Нет (0/12) Информация недостаточна
BM25 (Baseline) - База Да (Anchor) -

Влияние квантования и причины провалов

Авторы протестировали квантование до 4 бит (RTN, GPTQ, AWQ). Оказалось, что потеря качества зависит от размера модели, но ни одна квантованная модель не перешагнула порог пригодности. Разделение ошибок показало два типа сбоев:

  • Дефицит возможностей: модель физически не может решить задачу (T2, T4).
  • Настройка декодинга: ошибка связана с порогом логарифмической вероятности (logprob), которую можно исправить (T1, T3).

Практический вывод: Гибридный подход

Исследование рекомендует не заменять базовые алгоритмы на SLM полностью. Оптимальная стратегия — использовать SLM только там, где базовый метод (например, BM25) не справляется. Пример успешной реализации: ранжировщик на базе Qwen3-4B поверх списка, отфильтрованного BM25. Это дало прирост метрики +0.047 [0.020, 0.073], хотя сам по себе SLM-ранжировщик не прошел бы независимый тест на пригодность.

Источник: arXiv cs.AI ↗