От гибридной модели к раздельным веткам
На конференции Qwen: Towards a Generalist Model / Agent Цзюньян Лин представил архитектуру семейства Qwen3, но ключевой инсайт оказался не в параметрах, а в ошибках обучения. Лин признал, что попытка создать единую модель с «гибридным мышлением» (гибкое переключение между глубоким анализом и быстрым ответом) провалилась из-за конфликта целей.
Режим инструкций требует краткости и низкой задержки, а режим рассуждения — расхода токенов на сложные задачи. При неаккуратном слиянии обе способности деградировали: рассуждения становились раздутыми, а ответы — менее четкими. В результате команда Qwen отказалась от единой гибридной модели в пользу разделения на отдельные ветки Instruct и Thinking, что Лин называет «проблемой данных, а не архитектуры».
Архитектура Qwen3: цифры и спецификации
Презентация раскрыла технические детали моделей Qwen3, охватывающих диапазон от 0.6B до 235B параметров. Особое внимание уделено моделям с экспертами (MoE), где активация происходит только для части из 128 доступных экспертов. Ниже приведена сводка архитектурных характеристик, озвученных Лином:
| Модель | Слои | Головы (Q/KV) | Контекст | Особенности |
|---|---|---|---|---|
| Qwen3-0.6B | 28 | 16 / 8 | 32K | Связанные эмбеддинги |
| Qwen3-8B | 36 | 32 / 8 | 128K | Отсутствие связывания |
| Qwen3-30B-A3B | 48 | 32 / 4 | 128K | MoE: 8/128 экспертов |
| Qwen3-235B-A22B | 94 | 64 / 4 | 128K | MoE: 8/128 экспертов |
Смена парадигмы: от Reasoning к Agentic Thinking
Лин проводит четкую границу между двумя эрами развития ИИ. Первая эра, заданная моделями o1 и DeepSeek-R1, фокусировалась на «мышлении ради ответа» (Reasoning Thinking), где успех измерялся качеством внутреннего диалога перед выдачей результата. Вторая эра — «агентное мышление» (Agentic Thinking) — требует от модели не просто думать, а действовать в замкнутом цикле с окружением.
| Измерение | Reasoning Thinking | Agentic Thinking |
|---|---|---|
| Критерий успеха | Качество внутреннего обдумывания | Прогресс в действии в среде |
| Сигнал награды | Верифицируемый ответ (математика, код) | Успех задачи в интерактивной среде |
| Объект обучения | Только модель | Модель + окружение (harness) |
| Главная проблема | Раздутые, бесполезные цепочки рассуждений | Обман награды через доступ к инструментам |
Инфраструктурный вызов: разделение обучения и инференса
Переход к агентам создает новые инженерные барьеры. В отличие от «чистых» траекторий рассуждений, агентные системы работают через сложные «harness» (песочницы, браузеры, терминалы). Это требует строгого разделения процессов обучения и инференса. Если агент ждет выполнения теста кода в реальном времени, это блокирует инференс и снижает загрузку GPU, «голодая» процесс обучения.
Лин утверждает, что в эпоху агентов командам нужно оптимизировать не только разнообразие данных, но и качество среды: ее стабильность, реалистичность и устойчивость к эксплуатации (exploit resistance). Примеры успешного применения включают coding-агентов, которые итеративно исправляют ошибки через тестовые стенды, и системы глубокого исследования, самостоятельно отбрасывающие слабые источники.
Практическая реализация в Qwen3
Несмотря на теоретические сложности, Qwen3 предлагает гибкое управление через флаг enable_thinking. По умолчанию включен режим рассуждений с выводом в блоке , но пользователь может переключиться на мгновенный ответ или использовать мягкие переключатели /think и /no_think прямо в диалоге. Это позволяет динамически распределять вычислительный бюджет в зависимости от сложности задачи.
Источник: MarkTechPost ↗
