Исследования11 июля 2026 г., 04:17 МСК🤖 Auto

Qwen3-Next: Почему сильные модели не умеют упрощать задачи для обучения

Исследование выявило критический разрыв между способностью LLM решать сложные задачи и их умением адаптировать их под уровень ученика. Модели Qwen3-Next легко усложняют, но проваливаются при упрощении.

Баннер новости 3351

Проблема «одностороннего» контроля

Команда исследователей Yi Zhang и Julia Rayz представила новую методологию оценки образовательного контроля LLM, основанную на таксономии Блума. В центре внимания — способность модели сохранять намерение задачи, но изменять когнитивную нагрузку. Авторы протестировали эту гипотезу на паре моделей Qwen3-Next: Qwen3-Next-80B-A3B-Instruct (универсальная) и Qwen3-Coder-Next (специализированная для кода).

Эксперимент проводился на 2520 задачах из трех бенчмарков. Результаты показали устойчивую направленную асимметрию: обе модели надежно повышают когнитивную сложность, но демонстрируют серьезные трудности при попытке ее снизить. Это означает, что текущие SOTA-модели эффективны как «генераторы сложных задач», но ненадежны как «адаптеры для новичков».

Сравнение архитектур: Instruct vs Coder

Исследователи использовали семантическое кластеризацию и зондирование по слоям (Fisher's Discriminant Ratio) для анализа внутренних представлений моделей. Выяснилось, что универсальная модель Instruct лучше справляется с общим контролем сложности, тогда как Coder-версия демонстрирует более глубокие пики разделимости при работе с таксономией Блума.

Метрика / Характеристика Qwen3-Next-80B-A3B-Instruct Qwen3-Coder-Next
Основная специализация Универсальный инструктор Программирование (Coding)
Контроль общей сложности Четкая разделимость средних слоев Слабая разделимость
Контроль по таксономии Блума Стандартная реакция Глубокий пик разделимости
Снижение когнитивной нагрузки Низкая эффективность (проблемы с упрощением) Низкая эффективность (проблемы с упрощением)

Почему это важно для EdTech

Результаты подчеркивают важный тезис: высокая производительность в решении задач (execution performance) не гарантирует наличия навыков педагогического контроля (educational control). Для создания эффективных AI-репетиторов недостаточно просто обучать модели решать задачи — необходимо внедрять специализированные фреймворки, такие как Bloom-aligned, которые учат ИИ «понимать» уровень знаний ученика и адаптировать материал вниз, а не только вверх.

Настоящее исследование закладывает фундамент для следующего поколения образовательных AI, где критерием успеха становится не только правильность ответа, но и способность выстроить персонализированный путь обучения от простого к сложному.

Источник: arXiv cs.CL ↗