Релиз модели8 сентября 2026 г., 01:17 МСК🤖 Auto

MiniCPM5-2B: 2.5B параметров, 131K контекст и лидерство в агентах

OpenBMB выпустила плотную модель MiniCPM5-2B, которая обходит Qwen3.5-4B по среднему баллу в 34 тестах. Главная сила модели — работа с инструментами и кодом на устройстве.

Баннер новости 6973

Архитектура и совместимость

OpenBMB представила MiniCPM5-2B — вторую модель в серии MiniCPM5. Это плотная причинно-следственная языковая модель (dense causal language model) с 2,516,756,480 параметрами (из них 1,981,982,720 вне эмбеддингов). Архитектура построена на базе стандартного LlamaForCausalLM, что обеспечивает нативную поддержку в основных движках: vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX и FlagOS. Лицензия — Apache 2.0.

Ключевая особенность — нативное окно контекста в 131,072 токенов. Используется групповая запросная внимательность (grouped-query attention) с 16 заголовками запросов и 2 заголовками ключей/значений на 42 слоях.

Результаты бенчмарков: где модель сильна

MiniCPM5-2B набирает в среднем 53.9 балла по 34 тестам, опережая ближайшего конкурента в своем классе — Qwen3.5-4B (51.1 балла). Модель демонстрирует выдающиеся результаты в задачах использования инструментов (tool use) и кодинга, но уступает более крупным моделям в общих знаниях.

Категория / Тест MiniCPM5-2B Лучший конкурент (для сравнения) Примечание
Средний балл (34 теста) 53.9 Qwen3.5-4B (51.1) Лидерство в классе ~2-4B параметров
LiveCodeBench v6 (Код) 69.1 LFM2.5-2.6B (56.4) Значительное преимущество
SWE-bench Verified (Код) 46.4 LFM2.5-2.6B (33.6) Решение задач разработки
τ²-Bench Telecom (Инструменты) 97.1 Данные отсутствуют Использование API/инструментов
BFCL v4 (Инструменты) 66.6 LFM2.5-2.6B (6.8) Огромный разрыв в эффективности
NoLiMa (Длинный контекст) 68.1 LFM2.5-2.6B (43.5) Поиск в длинных документах
MMLU-Pro (Общие знания) 70.8 Qwen3.5-4B (78.0) Отставание от моделей большего размера

Уникальный рецепт обучения: RL + On-Policy Distillation

OpenBMB применила нетривиальный пайплайн обучения, чтобы максимизировать эффективность при малом количестве параметров:

  1. Базовое обучение: Использование метода управления данными UltraData.
  2. SFT (Supervised Fine-Tuning): 400B токенов с акцентом на «глубокое мышление» (deep-thinking).
  3. RL (Reinforcement Learning): Обучение специализированных учителей (teachers) для математики, кода, агентов и письма с использованием алгоритма JustRL II (critic-based).
  4. On-Policy Distillation (OPD): Финальный шаг, объединяющий 16 RL-экспертов (5 из которых — агенты) в одну модель. Вместо верификации преимущества используется обратное расхождение Кульбака-Лейблера (reverse KL divergence) между логитами студента и учителя.

Этот этап дал прирост в 10.96 балла на задачах рассуждений и 6.96 балла на агентных задачах.

Открытые данные и чеканка

Вместе с весами OpenBMB опубликовала датасеты: Ultra-FineWeb, UltraX UltraData-Code, UltraData-Math, а также специализированные наборы для SFT и RL (включая 500K примеров для агентов). Также доступны промежуточные чекпоинты (Base, Midtrain, SFT-only), что позволяет исследователям верифицировать вклад каждого этапа обучения.

Почему это важно

MiniCPM5-2B позиционируется не как универсальная модель знаний, а как эффективный инструмент для агентных задач и вызова инструментов на устройствах (on-device). Ее способность работать с длинным контекстом (131K) и высокой эффективностью использования API делает ее сильным кандидатом для локального развертывания умных ассистентов, не требующих облачных вычислений.

Источник: MarkTechPost ↗