Архитектура и совместимость
OpenBMB представила MiniCPM5-2B — вторую модель в серии MiniCPM5. Это плотная причинно-следственная языковая модель (dense causal language model) с 2,516,756,480 параметрами (из них 1,981,982,720 вне эмбеддингов). Архитектура построена на базе стандартного LlamaForCausalLM, что обеспечивает нативную поддержку в основных движках: vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX и FlagOS. Лицензия — Apache 2.0.
Ключевая особенность — нативное окно контекста в 131,072 токенов. Используется групповая запросная внимательность (grouped-query attention) с 16 заголовками запросов и 2 заголовками ключей/значений на 42 слоях.
Результаты бенчмарков: где модель сильна
MiniCPM5-2B набирает в среднем 53.9 балла по 34 тестам, опережая ближайшего конкурента в своем классе — Qwen3.5-4B (51.1 балла). Модель демонстрирует выдающиеся результаты в задачах использования инструментов (tool use) и кодинга, но уступает более крупным моделям в общих знаниях.
| Категория / Тест | MiniCPM5-2B | Лучший конкурент (для сравнения) | Примечание |
|---|---|---|---|
| Средний балл (34 теста) | 53.9 | Qwen3.5-4B (51.1) | Лидерство в классе ~2-4B параметров |
| LiveCodeBench v6 (Код) | 69.1 | LFM2.5-2.6B (56.4) | Значительное преимущество |
| SWE-bench Verified (Код) | 46.4 | LFM2.5-2.6B (33.6) | Решение задач разработки |
| τ²-Bench Telecom (Инструменты) | 97.1 | Данные отсутствуют | Использование API/инструментов |
| BFCL v4 (Инструменты) | 66.6 | LFM2.5-2.6B (6.8) | Огромный разрыв в эффективности |
| NoLiMa (Длинный контекст) | 68.1 | LFM2.5-2.6B (43.5) | Поиск в длинных документах |
| MMLU-Pro (Общие знания) | 70.8 | Qwen3.5-4B (78.0) | Отставание от моделей большего размера |
Уникальный рецепт обучения: RL + On-Policy Distillation
OpenBMB применила нетривиальный пайплайн обучения, чтобы максимизировать эффективность при малом количестве параметров:
- Базовое обучение: Использование метода управления данными UltraData.
- SFT (Supervised Fine-Tuning): 400B токенов с акцентом на «глубокое мышление» (deep-thinking).
- RL (Reinforcement Learning): Обучение специализированных учителей (teachers) для математики, кода, агентов и письма с использованием алгоритма JustRL II (critic-based).
- On-Policy Distillation (OPD): Финальный шаг, объединяющий 16 RL-экспертов (5 из которых — агенты) в одну модель. Вместо верификации преимущества используется обратное расхождение Кульбака-Лейблера (reverse KL divergence) между логитами студента и учителя.
Этот этап дал прирост в 10.96 балла на задачах рассуждений и 6.96 балла на агентных задачах.
Открытые данные и чеканка
Вместе с весами OpenBMB опубликовала датасеты: Ultra-FineWeb, UltraX UltraData-Code, UltraData-Math, а также специализированные наборы для SFT и RL (включая 500K примеров для агентов). Также доступны промежуточные чекпоинты (Base, Midtrain, SFT-only), что позволяет исследователям верифицировать вклад каждого этапа обучения.
Почему это важно
MiniCPM5-2B позиционируется не как универсальная модель знаний, а как эффективный инструмент для агентных задач и вызова инструментов на устройствах (on-device). Ее способность работать с длинным контекстом (131K) и высокой эффективностью использования API делает ее сильным кандидатом для локального развертывания умных ассистентов, не требующих облачных вычислений.
Источник: MarkTechPost ↗
