Паралдигма: малые модели как активные агенты
В статье arXiv:2609.13356 представлена архитектура ZGCM-1 (7B параметров), которая ломает стереотип о том, что компактные модели не могут конкурировать с флагманами. Авторы утверждают, что малые модели не должны пассивно запоминать веб, а должны компенсировать нехватку параметров за счет внутреннего обдумывания (internal thinking) и активного использования внешних инструментов (agentic search).
Модель обучена с нуля на 256K контекстном окне. Ключевая инновация — использование Markov Decision Processes (MDP) для переформулировки трасс взаимодействия агентов, что позволяет модели учиться стратегиям поиска и рассуждения в реальном времени.
Технические детали и эффективность
Разработчики внедрили «AI-native» рабочий процесс, где рои агентов (agent swarms) автономно управляют кластерами, курируют данные и проводят диагностику. Это позволило достичь рекордной эффективности:
- Архитектура: чередование gated sliding-window и full attention механизмов.
- Оптимизатор: стабильный FP8 Muon optimizer.
- Кривая обучения: улучшение времени до достижения целевой ошибки (time-to-loss) на 16K контексте примерно в 4.2 раза по сравнению с базовыми подходами.
- Куррикулум: прогрессивное масштабирование контекста через этапы 16K, 64K и 256K.
Сравнение с флагманами
Самое впечатляющее — результаты бенчмарков. Несмотря на то, что ZGCM-1 имеет всего 7 миллиардов параметров, она демонстрирует результаты, сопоставимые с моделями, имеющими сотни миллиардов параметров, в специфических, но критически важных задачах: математическом рассуждении и агентном поиске.
| Модель | Параметры | Специализация | Результат (относительный) |
|---|---|---|---|
| ZGCM-1 | 7B | Математика, Agentic Search | Конкурентен с флагманами |
| Qwen3-235B-A22B | 235B (активные) | Generalist | Базовый уровень для сравнения |
| GLM-5.1 | ~100B+ | Generalist | Базовый уровень для сравнения |
Полная открытость (Open Source)
Авторы выкладывают не только веса финальной модели, но и промежуточные чекпоинты (pre-training, mid-training, post-training), код обучения, рецепты данных и логи W&B. Это позволяет исследователям детально изучить, как именно MDP-подход и агентное со-обучение влияют на качество модели.
Для сообщества это важный шаг: ZGCM-1 доказывает, что можно достичь уровня «frontier» моделей в узких, но сложных задачах, используя меньшие вычислительные ресурсы и более умные алгоритмы обучения, а не просто масштабирование данных.
Источник: arXiv cs.AI ↗
