AI-новости6 октября 2026 г., 10:24 МСК🤖 Auto

Reflection AI выпустил Beam: 501B MoE с 23B активных параметров для кода

Reflection AI представила Beam — первую открытую модель с архитектурой MoE (501B параметров, 23B активных), оптимизированную для агентов и кодинга. Модель использует в 3-4 раза меньше вычислений, чем GLM 5.2, при сопоставимых результатах.

Баннер новости 9018

Эффективность вместо размера: новая парадигма

Reflection AI анонсировала Beam, свою первую модель с открытыми весами, позиционируемую как прямой конкурент более крупным открытым моделям, таким как GLM 5.2. Ключевое отличие Beam — архитектура Sparse Mixture-of-Experts (MoE) с 501 миллиардом общих параметров, но всего 23 миллиардами активных параметров на токен. Это позволяет модели использовать в 3–4 раза меньше вычислительных ресурсов при инференсе на бенчмарках рассуждений по сравнению с аналогами.

Модель разработана специально для задач кодинга, сложных рассуждений и работы агентов (agentic workloads). В отличие от Kimi K3, который лидирует по сырой мощности, Beam делает ставку на эффективность инференса. Пользователям доступен параметр «усилия рассуждения» (reasoning effort): низкие настройки дают краткие ответы, высокие — глубокий анализ для сложных задач, что позволяет балансировать между качеством и бюджетом вычислений.

Масштаб предобучения и RL

Предобучение Beam проводилось на 23,8 триллионах токенов (веб, публичные источники и лицензированные датасеты). Команда Reflection AI утверждает, что отфильтровала 95% «сырого» интернет-контента, сохранив около 1,8 триллиона высококачественных токенов, которые обычно отбрасываются стандартными фильтрами. Процесс занял менее 4 недель на 6 144 GPU NVIDIA GB300 NVL72, достигнув goodput на уровне 92,3%.

Центральным элементом масштабирования стало обучение с подкреплением (RL). Были использованы 10 500 GPU NVIDIA GB300 в течение 4 недель, сгенерировано более 100 миллионов роулаутов (rollouts). Система поддерживала в среднем 110 000 одновременных роулаутов, а новые веса доставлялись во флот инференса за медианные 12 секунд. Контекстное окно эффективно расширено до 1 миллиона токенов.

Сравнение с конкурентами

Beam демонстрирует сильные результаты в задачах программирования, хотя и уступает лидерам рынка по абсолютным цифрам. Ниже приведено сравнение ключевых характеристик и метрик.

Характеристика Reflection Beam GLM-5.2 Nemotron 3 Ultra DeepSeek V4.1 Flash Kimi K3
Разработчик Reflection AI (US) Z.ai (China) NVIDIA (US) DeepSeek (China) Moonshot AI (China)
Всего параметров 501B ~753B 550B 552B + 196B Engram 2.8T
Активных параметров 23B ~40B 55B 8B prefill / 16B decode 104B
Контекст 1M (effective) 1M Up to 1M 1M 1M
Входные данные Текст Текст Текст Текст + изображение Текст + изображение
Лицензия Apache 2.0 (планируется) MIT OpenMDW-1.1 MIT Kimi K3 License
SWE-bench Verified 80.9 — 70.7 — —
Terminal Bench v2.1 80.1 81.0 56.4 90.6 88.3

Безопасность и доступность

Для обеспечения безопасности Reflection AI обучила отдельного учителя (teacher model) на основе чекпоинта предобучения, используя метод многоучительской дистилляции на он-политике (multi-teacher on-policy distillation) и делиберативное выравнивание (deliberative alignment). Детали безопасности будут опубликованы в техническом отчете.

На данный момент Beam недоступна для самостоятельного хостинга. Модель находится на финальной стадии red-teaming. Ранний доступ предоставляется через лист ожидания на платформе Reflection AI. Ожидается, что веса модели под лицензией Apache 2.0 станут доступны в конце октября 2026 года.

Источник: MarkTechPost ↗