Релиз модели5 июля 2026 г., 09:15 МСК🤖 Auto

Бывший лидер Qwen: почему гибридное мышление провалилось и будущее за агентами

Цзюньян Лин, бывший техлид Alibaba Qwen, объяснил, почему попытка объединить режимы рассуждения и инструкций в Qwen3 привела к деградации модели, и обосновал переход индустрии от «мышления» к «агентному поведению».

Баннер новости 2914

От гибридной модели к раздельным веткам

На конференции Qwen: Towards a Generalist Model / Agent Цзюньян Лин представил архитектуру семейства Qwen3, но ключевой инсайт оказался не в параметрах, а в ошибках обучения. Лин признал, что попытка создать единую модель с «гибридным мышлением» (гибкое переключение между глубоким анализом и быстрым ответом) провалилась из-за конфликта целей.

Режим инструкций требует краткости и низкой задержки, а режим рассуждения — расхода токенов на сложные задачи. При неаккуратном слиянии обе способности деградировали: рассуждения становились раздутыми, а ответы — менее четкими. В результате команда Qwen отказалась от единой гибридной модели в пользу разделения на отдельные ветки Instruct и Thinking, что Лин называет «проблемой данных, а не архитектуры».

Архитектура Qwen3: цифры и спецификации

Презентация раскрыла технические детали моделей Qwen3, охватывающих диапазон от 0.6B до 235B параметров. Особое внимание уделено моделям с экспертами (MoE), где активация происходит только для части из 128 доступных экспертов. Ниже приведена сводка архитектурных характеристик, озвученных Лином:

Модель Слои Головы (Q/KV) Контекст Особенности
Qwen3-0.6B 28 16 / 8 32K Связанные эмбеддинги
Qwen3-8B 36 32 / 8 128K Отсутствие связывания
Qwen3-30B-A3B 48 32 / 4 128K MoE: 8/128 экспертов
Qwen3-235B-A22B 94 64 / 4 128K MoE: 8/128 экспертов

Смена парадигмы: от Reasoning к Agentic Thinking

Лин проводит четкую границу между двумя эрами развития ИИ. Первая эра, заданная моделями o1 и DeepSeek-R1, фокусировалась на «мышлении ради ответа» (Reasoning Thinking), где успех измерялся качеством внутреннего диалога перед выдачей результата. Вторая эра — «агентное мышление» (Agentic Thinking) — требует от модели не просто думать, а действовать в замкнутом цикле с окружением.

Измерение Reasoning Thinking Agentic Thinking
Критерий успеха Качество внутреннего обдумывания Прогресс в действии в среде
Сигнал награды Верифицируемый ответ (математика, код) Успех задачи в интерактивной среде
Объект обучения Только модель Модель + окружение (harness)
Главная проблема Раздутые, бесполезные цепочки рассуждений Обман награды через доступ к инструментам

Инфраструктурный вызов: разделение обучения и инференса

Переход к агентам создает новые инженерные барьеры. В отличие от «чистых» траекторий рассуждений, агентные системы работают через сложные «harness» (песочницы, браузеры, терминалы). Это требует строгого разделения процессов обучения и инференса. Если агент ждет выполнения теста кода в реальном времени, это блокирует инференс и снижает загрузку GPU, «голодая» процесс обучения.

Лин утверждает, что в эпоху агентов командам нужно оптимизировать не только разнообразие данных, но и качество среды: ее стабильность, реалистичность и устойчивость к эксплуатации (exploit resistance). Примеры успешного применения включают coding-агентов, которые итеративно исправляют ошибки через тестовые стенды, и системы глубокого исследования, самостоятельно отбрасывающие слабые источники.

Практическая реализация в Qwen3

Несмотря на теоретические сложности, Qwen3 предлагает гибкое управление через флаг enable_thinking. По умолчанию включен режим рассуждений с выводом в блоке ..., но пользователь может переключиться на мгновенный ответ или использовать мягкие переключатели /think и /no_think прямо в диалоге. Это позволяет динамически распределять вычислительный бюджет в зависимости от сложности задачи.

Источник: MarkTechPost ↗