Релиз модели24 сентября 2026 г., 14:21 МСК🤖 Auto

Tencent Hunyuan-A13B: 80B параметров, 13B активации и умное мышление

Tencent представила открытую LLM Hunyuan-A13B с архитектурой MoE, которая активирует лишь 13 млрд параметров из 80 млрд, обеспечивая высокую скорость вывода и конкурентоспособные результаты в STEM и коде.

Баннер новости 8190

Архитектура MoE: баланс мощности и скорости

Hunyuan-A13B от Tencent Hunyuan Team — это крупная языковая модель (LLM), использующая архитектуру Mixture-of-Experts (MoE). Ключевая особенность модели заключается в эффективном распределении вычислительных ресурсов: хотя общее количество параметров составляет 80 миллиардов, во время инференса (вывода) активными являются только 13 миллиардов. Это позволяет модели сохранять высокую интеллектуальную емкость, характерную для гигантов индустрии, но при этом обеспечивать низкую задержку и экономичность развертывания.

Обучение на 20 трлн токенов с упором на STEM

Модель предварительно обучена на тщательно отфильтрованном корпусе данных объемом 20 триллионов токенов. Особое внимание команда уделила курированию данных в области естественных наук, технологий, инженерии и математики (STEM). Это напрямую повлияло на фактологическую надежность модели и ее способность к сложному логическому рассуждению. Далее процесс был дополнен высококачественным контролируемым дообучением (SFT) и масштабным обучением с подкреплением (RL).

Двухрежимное мышление (Chain-of-Thought)

Одной из инноваций Hunyuan-A13B является внедрение двухрежимной цепочки рассуждений (Chain-of-Thought). Модель динамически адаптирует глубину анализа в зависимости от сложности задачи:

  • Быстрое мышление (Fast Thinking): используется для рутинных запросов, требующих мгновенного ответа.
  • Медленное мышление (Slow Thinking): активируется для сложных, многошаговых проблем, где требуется глубокий анализ и верификация.

Результаты бенчмарков

Оценки показывают, что Hunyuan-A13B демонстрирует конкурентоспособные результаты в математике, науке, программировании, общем понимании языка и задачах агентов. По многим метрикам модель приближается к производительности значительно более крупных аналогов, что делает ее привлекательной для приложений, чувствительных к задержкам (latency-sensitive applications).

Характеристика Значение / Описание
Архитектура Mixture-of-Experts (MoE)
Общее число параметров 80 миллиардов
Активные параметры (инференс) 13 миллиардов
Объем данных предобучения 20 трлн токенов
Ключевая особенность Двухрежимное CoT (Fast/Slow thinking)
Статус Open-source (открытый код и веса)

Значение для рынка

Выпуск Hunyuan-A13B знаменует собой важный шаг в направлении доступных, но мощных моделей. Сочетание высокой пропускной способности инференса и улучшенных способностей к рассуждению делает эту модель идеальным кандидатом для практического развертывания в коммерческих продуктах, где критичны как скорость ответа, так и качество решения сложных задач.

Источник: arXiv cs.AI ↗