Главная/Блог/Аналитика/От гибридного мышления к агентам:…
Аналитика11 мин чтения · 5 июля 2026 г.

От гибридного мышления к агентам: инсайты экс-лидера Qwen

Бывший технический лидер проекта Qwen Цзюньян Лин объясняет, почему объединение режимов рассуждения и инструкций оказалось тупиком, и почему будущее ИИ — за автономными агентами.

От гибридного мышления к агентам: инсайты экс-лидера Qwen

Индустрия искусственного интеллекта находится в состоянии переломного момента. То, что еще вчера казалось вершиной развития больших языковых моделей (LLM), сегодня выглядит лишь промежуточным этапом. Ярким примером этого сдвига стало недавнее заявление Цзюняна Лина (Junyang Lin), бывшего технического лидера проекта Qwen от Alibaba. 3 марта 2026 года он объявил о выходе из проекта, чтобы продолжить исследования в качестве независимого ученого. Но его уход — это не просто смена работы, это сигнал о смене парадигмы. В своем выступлении и последующем подробном блоге Лин не просто презентует новые модели, он деконструирует устоявшиеся представления о том, как должны работать ИИ-системы.

Ключевой тезис его выступления звучит лаконично и провокационно: «Обучение моделей → обучение агентов». Эта фраза, кажущаяся простой на первый взгляд, на самом деле содержит в себе приговор эпохе «чистого» рассуждения и манифест новой эры, где ИИ должен не просто думать, но и действовать. В этой статье мы подробно разберем, почему попытка объединить режимы «мышления» и «инструкций» в одной модели привела к компромиссам, которые Лин считает ошибочными, и почему инфраструктура для обучения агентов требует совершенно иного подхода, чем то, к чему мы привыкли.

01Что на самом деле скрывается за презентацией Qwen

Выступление Цзюняна Лина часто ошибочно воспринимают как анонс одного конкретного релиза. На самом деле это масштабный обзор семейства моделей Qwen, который охватывает эволюцию от QwQ-32B до Qwen3, включая визуальные (Qwen2.5-VL) и мультимодальные (Qwen2.5-Omni) версии. Лин проводит аудиторию через серию бенчмарков, где Qwen сравнивается с ключевыми конкурентами: DeepSeek-R1, Grok 3 Beta, Gemini 2.5 Pro и серией o-series от OpenAI. Это не просто хвастовство результатами, а демонстрация того, как архитектура Qwen адаптируется под разные задачи.

Особое внимание уделяется модели Qwen3. Именно здесь Лин вводит понятие «гибридного мышления» (hybrid thinking). Идея заключалась в том, чтобы дать пользователю выбор: использовать режим пошагового рассуждения для сложных задач или режим мгновенного ответа для простых запросов. Кроме того, была внедрена функция динамического бюджета мышления, позволяющая ограничивать количество токенов, которые модель тратит на размышления. Qwen3 также расширил поддержку языков с 29 до 119, что делает его одним из самых мультиязычных решений на рынке. Однако, несмотря на техническое совершенство, презентация заканчивается слайдом «Будущая работа», где главной целью названо создание агентов.

График сравнения производительности Qwen с конкурентами
График сравнения производительности Qwen с конкурентами

02Архитектура Qwen3: от плотных моделей к MoE

Чтобы понять масштаб изменений, нужно взглянуть на технические спецификации. Семейство Qwen3 варьируется от компактных 0.6B до мощных 235B параметров. Лин подробно раскрывает архитектуру, демонстрируя переход от плотных моделей (dense) к моделям с экспертами (Mixture of Experts, MoE).

Маленькие модели (0.6B, 1.7B, 4B) используют привязку входных и выходных эмбеддингов (Tie Embedding) и поддерживают контекст до 32K токенов. Это оптимально для локального запуска и экономии ресурсов. Однако, как только мы переходим к моделям размером от 8B и выше, привязка отключается, а контекстное окно расширяется до 128K. Это критически важно для агентов, которым нужно удерживать в памяти длинные истории взаимодействий и документацию.

Особый интерес представляют две модели на базе архитектуры MoE: Qwen3-30B-A3B и Qwen3-235B-A22B. В них используется 128 экспертов, но на каждом шаге активизируется только 8. Это позволяет модели обрабатывать огромные объемы данных с относительно низкими вычислительными затратами. Такая архитектура идеально подходит для сложных задач, требующих специализированных знаний в разных областях, что является фундаментом для будущих агентов.

Портрет Цзюняна Лина, бывшего технического лидера Qwen
Портрет Цзюняна Лина, бывшего технического лидера Qwen

Таблица архитектуры Qwen3

Ниже приведены ключевые параметры, которые Лин представил в своем докладе. Обратите внимание на разницу в контексте и активации экспертов между плотными и MoE моделями.

Модель Слои Головы (Q/KV) Привязка / Эксперты (Всего / Актив.) Контекст
Qwen3-0.6B 28 16 / 8 Привязка: Да 32K
Qwen3-1.7B 28 16 / 8 Привязка: Да 32K
Qwen3-4B 36 32 / 8 Привязка: Да 32K
Qwen3-8B 36 32 / 8 Привязка: Нет 128K
Qwen3-14B 40 40 / 8 Привязка: Нет 128K
Qwen3-32B 64 64 / 8 Привязка: Нет 128K
Qwen3-30B-A3B 48 32 / 4 Эксперты: 128 / 8 128K
Qwen3-235B-A22B 94 64 / 4 Эксперты: 128 / 8 128K

03Гибридное мышление: почему объединение режимов оказалось сложной задачей

Одной из самых интригующих частей выступления Лина стало объяснение того, почему попытка создать единую модель, которая идеально работает и в режиме «мышления» (для сложных задач), и в режиме «инструкций» (для быстрых ответов), оказалась проблематичной. На первый взгляд, это кажется логичным: пользователь выбирает режим, и модель адаптируется. Однако Лин объясняет, что эти два режима тянут модель в противоположные стороны.

Сильная модель, обученная на инструкциях (instruct model), поощряется за прямизну, краткость и низкую задержку. Она должна давать ответ сразу. Сильная модель, обученная на рассуждениях (thinking model), поощряется за то, чтобы тратить больше токенов на сложные проблемы, размышляя шаг за шагом. Если объединить эти два подхода небрежно, обе способности деградируют. Режим мышления становится раздутым и медленным, а режим инструкций теряет свою четкость и скорость.

Qwen3 попытался решить эту проблему с помощью четырехэтапного процесса постобучения, который включал холодный старт с длинными цепочками рассуждений (long-CoT), рассуждающее обучение с подкреплением (reasoning RL) и шаг «слияния режимов мышления». Однако, как признает Лин, это была проблема данных, а не архитектуры. В итоге, в линии 2507, выпущенной позже в 2025 году, команда Alibaba решила выпустить отдельные варианты Instruct и Thinking. Это решение позволило сохранить качество каждого режима, но лишило пользователя удобства переключения внутри одной модели.

Схема архитектуры Qwen3
Схема архитектуры Qwen3
💡
Альтернативный подход Anthropic. Лин отмечает, что Anthropic пошла по другому пути. Модель Claude 3.7 Sonnet была выпущена как гибридная модель с настраиваемым бюджетом мышления для пользователя. А Claude 4 позволил рассуждению переплетаться с использованием инструментов, что особенно важно для программирования и длительных задач. Вывод Лина прост: более длинная цепочка рассуждений не делает модель умнее. Мышление должно формироваться под конкретную рабочую нагрузку, а не под бенчмарки.

04От «рассуждающего» мышления к «агентному» мышлению

Лин проводит четкую границу между двумя эрами развития ИИ. Первая эра, определяемая моделями o1 и DeepSeek-R1, была эрой «рассуждающего мышления» (reasoning thinking). Она научила индустрию тому, что обучение с подкреплением (RL) требует детерминированных, верифицируемых наград. Поэтому математика, код и логика стали центральными элементами обучения. RL превратился в системную проблему масштабных роулаутов (rollouts) и верификации.

Вторая эра, по мнению Лина, — это эра «агентного мышления» (agentic thinking). Здесь мышление используется не для того, чтобы просто прийти к правильному ответу в вакууме, а для того, чтобы действовать. Агент формулирует планы, решает, когда действовать, использует инструменты, читает обратную связь от среды и корректирует свои действия. Это замкнутый цикл взаимодействия с миром, а не длинный внутренний монолог.

Агентное мышление должно решать задачи, которых можно избежать в чистом рассуждении:

  • Принимать решение, когда прекратить думать и начать действовать.
  • Выбирать, какой инструмент вызвать, и в каком порядке.
  • Включать в процесс шумные или частичные наблюдения из окружающей среды.
  • Корректировать планы после сбоев.
  • Поддерживать связность на протяжении многих ходов и вызовов инструментов.

Целевая функция оптимизации меняется. Если раньше модель оценивалась по качеству внутреннего размышления, то теперь — по тому, сохраняется ли прогресс в действии. Награда больше не приходит от верифицируемого ответа, а от успеха задачи во взаимодействующей среде.

Пример кода для переключения режимов мышления
Пример кода для переключения режимов мышления

Сравнение эпох мышления

Измерение Рассуждающее мышление Агентное мышление
Оценивается по Качеству внутреннего размышления перед ответом Сохранению прогресса во время действия
Сигнал награды Верифицируемые ответы (математика, код, логика) Успех задачи во взаимодействующей среде
Основной объект обучения Модель Модель плюс ее среда (инфраструктура)
Узкое место инфраструктуры Роулауты, верификация, стабильные обновления политик Серверы инструментов, песочницы, разделение обучения и вывода
Основной режим отказа Раздутые, низкоценные цепочки рассуждений Обман награды через доступ к инструментам и утечки среды

05Практические примеры: как это меняет разработку

Различие между рассуждением и агентным мышлением кардинально меняет подход к построению приложений. Рассмотрим несколько ключевых сценариев.

Агенты для программирования. Рассуждающая модель может выдать один патч на основе стека ошибок. Агентная система запускает тестовый стенд, читает реальную ошибку, корректирует код и запускает тесты снова, пока весь набор тестов не пройдет. Здесь мышление помогает навигации по кодовой базе, восстановлению после ошибок и оркестровке инструментов. Это не просто генерация кода, это итеративный процесс.

Глубокие исследования (Deep Research). Рассуждающая модель пишет длинный ответ, опираясь на память. Агентная система разбивает вопрос на подзапросы, вызывает поиск, отбрасывает слабые источники и возвращает обоснованные цитаты. Демонстрация Deep Research от Qwen как раз попадает в эту категорию. Это процесс, требующий постоянного взаимодействия с внешним миром (интернетом, базами данных).

Мультиагентная оркестровка. Лин ожидает, что «инженерия стендов» (harness engineering) станет важнее. Оркестратор планирует и распределяет работу. Специализированные суб-агенты выполняют более узкие задачи, помогая контролировать загрязнение контекста. Это переход от одного «мозга» к распределенной системе.

Диаграмма сравнения рассуждающего и агентного мышления
Диаграмма сравнения рассуждающего и агентного мышления

06Техническая реализация: переключатель мышления в Qwen3

Несмотря на критику гибридного подхода, Qwen3 все еще предоставляет прямой доступ к переключению режимов через флаг enable_thinking. Это позволяет разработчикам экспериментировать с тем, как модель ведет себя в разных режимах. По умолчанию enable_thinking=True, и вывод оборачивается в блок ..., что позволяет пользователю видеть процесс рассуждения. Qwen3 также принимает мягкие переключатели: добавление /think или /no_think к сообщению пользователя переключает режим для конкретного сообщения. Этот контроль на уровне сообщений является основой для динамических бюджетов мышления.

terminalpython
from transformers import AutoModelForCausalLM, AutoTokenizer

name = "Qwen/Qwen3-8B"
tok = AutoTokenizer.from_pretrained(name)
model = AutoModelForCausalLM.from_pretrained(name, torch_dtype="auto", device_map="auto")

messages = [
    {"role": "user", "content": "Refactor this function and explain the change."}
]

# enable_thinking=True  -> step-by-step thinking mode
# enable_thinking=False -> near-instant, non-thinking mode

text = tok.apply_chat_template(
    messages,
    tokenize=False,
    add_generation_prompt=True,
    enable_thinking=True
)
inputs = tok(text, return_tensors="pt").to(model.device)

# Рекомендованные параметры выборки для режима мышления от Qwen
out = model.generate(
    **inputs,
    max_new_tokens=2048,
    temperature=0.6,
    top_p=0.95,
    top_k=20,
    enable_thinking=True
)

07Почему инфраструктура для агентного RL сложнее

Ключевой инженерный вывод выступления Лина касается инфраструктуры. В рассуждающем RL роулауты в основном являются самодостаточными траекториями с чистыми оценщиками. В агентном RL политика живет внутри «стенда» (harness), состоящего из серверов инструментов, браузеров, терминалов и песочниц.

Этот стенд накладывает новое требование: обучение и вывод (inference) должны быть четко разделены. Без этого пропускная способность роулаутов падает. Агент программирования, ожидающий выполнения тестов в реальном времени, блокирует вывод и лишает обучения. Загрузка GPU падает далеко ниже того уровня, который достигается в рассуждающем RL. Лин также переосмысливает, на чем следует сосредоточиться. В эпоху SFT (Supervised Fine-Tuning) команды оптимизировали разнообразие данных. В эпоху агентов, по его мнению, команды должны оптимизировать качество среды: стабильность, реализм, покрытие и устойчивость к эксплуатации. Он называет обман награды (reward hacking) самой сложной проблемой, так как доступ к инструментам расширяет поверхность атаки для ложной оптимизации.

⚠️
Важно для разработчиков. Если вы планируете строить агентов на базе открытых моделей, обратите внимание, что проблема больше не в том, как заставить модель «думать», а в том, как создать стабильную среду, в которой она может действовать. Инфраструктура становится таким же важным компонентом, как и сама модель.

08Что это значит на практике

Для разработчиков и компаний, работающих с ИИ, выводы Цзюняна Лина имеют прямое практическое значение. Во-первых, отказ от попыток создать универсальную модель, которая идеально работает во всех режимах, в пользу специализированных решений или четкого разделения режимов, может привести к более предсказуемым результатам. Во-вторых, фокус смещается с тонкой настройки моделей на создание качественных сред для обучения агентов. Это требует инвестиций в инфраструктуру: серверы инструментов, песочницы, системы мониторинга.

В-третьих, необходимо пересмотреть метрики успеха. Больше нельзя полагаться только на бенчмарки, такие как MATH или GSM8K. Нужно оценивать способность модели к sustained action — устойчивому действию в сложной, изменчивой среде. И, наконец, безопасность становится критическим аспектом. Доступ к инструментам открывает новые векторы атак, и модели нужно обучать не только эффективности, но и осторожности.

Уход Лина из Qwen — это не конец, а начало нового этапа. Его работа показывает, что путь от «умного чата» к «автономному помощнику» требует не просто больших данных, а новой инженерной философии. Будущее ИИ — за агентами, которые не просто отвечают на вопросы, а решают проблемы в реальном мире.

09Источники и дополнительные материалы

Основной источник — выступление Цзюняна Лина: YouTube Video. Подробный пост: From 'Reasoning' Thinking to 'Agentic' Thinking. Технический отчет Qwen3: arXiv:2505.09388. Документация Qwen: Qwen Docs. Информация об уходе: TechCrunch, Bloomberg.

Источник: MarkTechPost ↗