Релиз модели15 сентября 2026 г., 07:19 МСК🤖 Auto

ZGCM-1: 7B-модель, бьющая гигантов в математике и агентах

Команда из 24 исследователей представила ZGCM-1 — полностью открытую 7B-модель, которая на сложных задачах сравнима с Qwen3-235B и GLM-5.1 за счет уникального обучения агентами.

Баннер новости 7509

Паралдигма: малые модели как активные агенты

В статье arXiv:2609.13356 представлена архитектура ZGCM-1 (7B параметров), которая ломает стереотип о том, что компактные модели не могут конкурировать с флагманами. Авторы утверждают, что малые модели не должны пассивно запоминать веб, а должны компенсировать нехватку параметров за счет внутреннего обдумывания (internal thinking) и активного использования внешних инструментов (agentic search).

Модель обучена с нуля на 256K контекстном окне. Ключевая инновация — использование Markov Decision Processes (MDP) для переформулировки трасс взаимодействия агентов, что позволяет модели учиться стратегиям поиска и рассуждения в реальном времени.

Технические детали и эффективность

Разработчики внедрили «AI-native» рабочий процесс, где рои агентов (agent swarms) автономно управляют кластерами, курируют данные и проводят диагностику. Это позволило достичь рекордной эффективности:

  • Архитектура: чередование gated sliding-window и full attention механизмов.
  • Оптимизатор: стабильный FP8 Muon optimizer.
  • Кривая обучения: улучшение времени до достижения целевой ошибки (time-to-loss) на 16K контексте примерно в 4.2 раза по сравнению с базовыми подходами.
  • Куррикулум: прогрессивное масштабирование контекста через этапы 16K, 64K и 256K.

Сравнение с флагманами

Самое впечатляющее — результаты бенчмарков. Несмотря на то, что ZGCM-1 имеет всего 7 миллиардов параметров, она демонстрирует результаты, сопоставимые с моделями, имеющими сотни миллиардов параметров, в специфических, но критически важных задачах: математическом рассуждении и агентном поиске.

Модель Параметры Специализация Результат (относительный)
ZGCM-1 7B Математика, Agentic Search Конкурентен с флагманами
Qwen3-235B-A22B 235B (активные) Generalist Базовый уровень для сравнения
GLM-5.1 ~100B+ Generalist Базовый уровень для сравнения

Полная открытость (Open Source)

Авторы выкладывают не только веса финальной модели, но и промежуточные чекпоинты (pre-training, mid-training, post-training), код обучения, рецепты данных и логи W&B. Это позволяет исследователям детально изучить, как именно MDP-подход и агентное со-обучение влияют на качество модели.

Для сообщества это важный шаг: ZGCM-1 доказывает, что можно достичь уровня «frontier» моделей в узких, но сложных задачах, используя меньшие вычислительные ресурсы и более умные алгоритмы обучения, а не просто масштабирование данных.

Источник: arXiv cs.AI ↗