Суть проблемы: «Разрыв пригодности» (Eligibility Gap)
Исследователи Jundong Hu и Shekar Ramachandran из arXiv (2026) провели строгий аудит использования Small Language Models (SLM) в качестве «рабочих лошадок» для агентов. В то время как крупные LLM выступают в роли планировщиков, SLM должны выполнять рутинные микрозадачи: авто-одобрение команд, запись в память, ранжирование диалогов и выбор инструментов. Авторы ввели понятие «разрыва пригодности» — ситуации, когда модель формально способна выполнить задачу, но не достигает заданного практиком порога надежности (threshold τ).
Методология и бенчмарк
Для проверки был создан бенчмарк из 4 микрозадач с фиксированными промптами и автоматическими метриками. Ключевая особенность теста — использование доверительных интервалов (CI): конфигурация считается годной только если нижняя граница доверительного интервала превышает порог τ, установленный на основе дешевых не-LLM базовых решений (например, BM25). Тестировались модели Qwen3 (0.6B, 1.7B, 4B, 8B) в режиме FP16, greedy-декодинга, без дообучения.
Результаты: 0 из 16 прошли тест
Результаты оказались категоричными: ни одна из 16 протестированных конфигураций (4 модели × 4 задачи) не прошла порог пригодности. Даже при проверке сырых выводов и поведения парсеров не было найдено ни одного успешного кейса. Это доказывает, что «out-of-the-box» SLM пока недостаточны для надежной автоматизации микрозадач без тонкой настройки или гибридных схем.
| Модель / Конфигурация | Размер | Точность (прибл.) | Прошел порог τ? | Влияние 4-bit квантования |
|---|---|---|---|---|
| Qwen3 | 0.6B - 8B | Ниже порога | Нет (0/16) | Ухудшает результат, не меняя статус |
| Llama-3.x | 12B | Ниже порога | Нет (0/12) | Информация недостаточна |
| BM25 (Baseline) | - | База | Да (Anchor) | - |
Влияние квантования и причины провалов
Авторы протестировали квантование до 4 бит (RTN, GPTQ, AWQ). Оказалось, что потеря качества зависит от размера модели, но ни одна квантованная модель не перешагнула порог пригодности. Разделение ошибок показало два типа сбоев:
- Дефицит возможностей: модель физически не может решить задачу (T2, T4).
- Настройка декодинга: ошибка связана с порогом логарифмической вероятности (logprob), которую можно исправить (T1, T3).
Практический вывод: Гибридный подход
Исследование рекомендует не заменять базовые алгоритмы на SLM полностью. Оптимальная стратегия — использовать SLM только там, где базовый метод (например, BM25) не справляется. Пример успешной реализации: ранжировщик на базе Qwen3-4B поверх списка, отфильтрованного BM25. Это дало прирост метрики +0.047 [0.020, 0.073], хотя сам по себе SLM-ранжировщик не прошел бы независимый тест на пригодность.
Источник: arXiv cs.AI ↗
