Эффективность вместо размера: новая парадигма
Reflection AI анонсировала Beam, свою первую модель с открытыми весами, позиционируемую как прямой конкурент более крупным открытым моделям, таким как GLM 5.2. Ключевое отличие Beam — архитектура Sparse Mixture-of-Experts (MoE) с 501 миллиардом общих параметров, но всего 23 миллиардами активных параметров на токен. Это позволяет модели использовать в 3–4 раза меньше вычислительных ресурсов при инференсе на бенчмарках рассуждений по сравнению с аналогами.
Модель разработана специально для задач кодинга, сложных рассуждений и работы агентов (agentic workloads). В отличие от Kimi K3, который лидирует по сырой мощности, Beam делает ставку на эффективность инференса. Пользователям доступен параметр «усилия рассуждения» (reasoning effort): низкие настройки дают краткие ответы, высокие — глубокий анализ для сложных задач, что позволяет балансировать между качеством и бюджетом вычислений.
Масштаб предобучения и RL
Предобучение Beam проводилось на 23,8 триллионах токенов (веб, публичные источники и лицензированные датасеты). Команда Reflection AI утверждает, что отфильтровала 95% «сырого» интернет-контента, сохранив около 1,8 триллиона высококачественных токенов, которые обычно отбрасываются стандартными фильтрами. Процесс занял менее 4 недель на 6 144 GPU NVIDIA GB300 NVL72, достигнув goodput на уровне 92,3%.
Центральным элементом масштабирования стало обучение с подкреплением (RL). Были использованы 10 500 GPU NVIDIA GB300 в течение 4 недель, сгенерировано более 100 миллионов роулаутов (rollouts). Система поддерживала в среднем 110 000 одновременных роулаутов, а новые веса доставлялись во флот инференса за медианные 12 секунд. Контекстное окно эффективно расширено до 1 миллиона токенов.
Сравнение с конкурентами
Beam демонстрирует сильные результаты в задачах программирования, хотя и уступает лидерам рынка по абсолютным цифрам. Ниже приведено сравнение ключевых характеристик и метрик.
| Характеристика | Reflection Beam | GLM-5.2 | Nemotron 3 Ultra | DeepSeek V4.1 Flash | Kimi K3 |
|---|---|---|---|---|---|
| Разработчик | Reflection AI (US) | Z.ai (China) | NVIDIA (US) | DeepSeek (China) | Moonshot AI (China) |
| Всего параметров | 501B | ~753B | 550B | 552B + 196B Engram | 2.8T |
| Активных параметров | 23B | ~40B | 55B | 8B prefill / 16B decode | 104B |
| Контекст | 1M (effective) | 1M | Up to 1M | 1M | 1M |
| Входные данные | Текст | Текст | Текст | Текст + изображение | Текст + изображение |
| Лицензия | Apache 2.0 (планируется) | MIT | OpenMDW-1.1 | MIT | Kimi K3 License |
| SWE-bench Verified | 80.9 | — | 70.7 | — | — |
| Terminal Bench v2.1 | 80.1 | 81.0 | 56.4 | 90.6 | 88.3 |
Безопасность и доступность
Для обеспечения безопасности Reflection AI обучила отдельного учителя (teacher model) на основе чекпоинта предобучения, используя метод многоучительской дистилляции на он-политике (multi-teacher on-policy distillation) и делиберативное выравнивание (deliberative alignment). Детали безопасности будут опубликованы в техническом отчете.
На данный момент Beam недоступна для самостоятельного хостинга. Модель находится на финальной стадии red-teaming. Ранний доступ предоставляется через лист ожидания на платформе Reflection AI. Ожидается, что веса модели под лицензией Apache 2.0 станут доступны в конце октября 2026 года.
Источник: MarkTechPost ↗
