Исследования21 июля 2026 г., 09:16 МСК🤖 Auto

Малые модели для локального AI: бенчмарк и PEFT-адаптация

Исследование демонстрирует, что модели от 135M до 3B параметров с помощью 4-bit квантования и LoRA-адаптеров достигают высокой точности на узких задачах, делая локальный AI доступным для обычных учреждений.

Баннер новости 4012

Демократизация AI через локальные модели

Даниэль Черсоццо (Daniel Cersosimo) в статье arXiv:2607.16206 (подана 5 мая 2026 г.) доказывает, что демократизация искусственного интеллекта зависит не от гонки за «фронтирными» моделями, а от возможности выбора, аудита и специализации моделей в рамках жестких аппаратных и governance-ограничений. Автор предлагает структурированный подход к локальному развертыванию, где ключевую роль играют малые языковые модели (SLM).

Структурированный бенчмарк: 16 тем, 1085 примеров

Для оценки была разработана специализированная тестовая выборка из 1085 примеров, охватывающих 16 тем. Бенчмарк сфокусирован на задачах, критичных для локального применения:

  • Символьная точность (symbolic precision);
  • Строгое форматирование вывода;
  • Извлечение данных (extraction);
  • Принятие семантических решений с коротким горизонтом.

Особое требование — протокол вывода строго в одну букву (one-letter output protocol), что исключает «воду» и требует высокой концентрации модели на сути задачи.

Результаты базовой оценки (Base Evaluation)

В ходе тестирования девяти открытых моделей с количеством параметров от 135M до 3B лидирующие позиции заняли модели семейства Qwen. Ниже представлены топ-4 модели по строгой точности (strict accuracy) в базовой конфигурации:

d>
Модель Параметры Строгая точность
Qwen Coder 3B 3B 75.67%
Qwen2.5 1.5B 1.5B 67.10%
Qwen3.5 2B2B 64.98%
Granite 3.3 2B 2B 64.61%

Эффект PEFT-адаптации: скачок точности

Самый важный вывод исследования касается параметрически эффективной донастройки (PEFT). Используя 4-bit NF4 квантование и адаптеры в стиле DoRA/LoRA на бюджетном оборудовании уровня NVIDIA L4, исследователи адаптировали подмножество моделей на выделенном сплите из 108 примеров. Результатом стал значительный прирост точности:

Модель Прирост точности (+Δ)
Qwen Coder 3B +26.85 п.п.
SmolLM2 1.7B +25.92 п.п.
Qwen2.5 1.5B +19.44 п.п.
SmolLM2 360M +10.18 п.п.
SmolLM2 135M +5.55 п.п.

Почему это важно для индустрии

Исследование подтверждает, что дисциплинированный рабочий процесс — включающий создание специализированных бенчмарков, кросс-модельную оценку и недорогую специализацию — уже делает модели размером менее 3B параметров жизнеспособными «локальными экспертами» для узких нишевых задач. Это снижает барьер входа для организаций, которые не могут позволить себе облачные API или мощные GPU, позволяя развертывать надежный AI на ограниченных ресурсах.

Источник: arXiv cs.AI ↗