Релиз модели7 июля 2026 г., 10:16 МСК🤖 Auto

Tencent выпустила Hy3: 295B MoE с 21B активных параметров и контекстом 256K

Tencent открыла веса модели Hy3 (Apache 2.0), оптимизированной для агентов и длинных контекстов. Модель активирует лишь 21B параметров на токен, предлагая баланс между производительностью и стоимостью инференса.

Баннер новости 3014

Архитектура и ключевые характеристики

Hy3 — это разреженная модель типа Mixture-of-Experts (MoE) с общим объемом 295 миллиардов параметров. Ключевая особенность архитектуры: использование 192 экспертов с маршрутизацией top-8. Это означает, что для обработки каждого токена задействуется только 8 экспертов, что снижает вычислительные затраты. Модель поддерживает контекстное окно до 256K токенов и включает слой Multi-Token Prediction (MTP) объемом 3.8B параметров для ускорения декодирования через спекулятивный вывод.

Параметр Значение
Общее число параметров 295B
Активные параметры на токен 21B
Количество экспертов 192 (активируется 8)
Длина контекста 256K токенов
Размер словаря 120,832
Лицензия Apache 2.0

Результаты бенчмарков: Код, STEM и надежность

Модель демонстрирует сильные результаты в задачах программирования и сложных рассуждений. Особое внимание разработчики уделили стабильности работы с инструментами (tool calling) и снижению галлюцинаций. Внутренние тесты показали снижение уровня галлюцинаций с 12.5% до 5.4%, а ошибок здравого смысла — с 25.4% до 12.7%. В слепом тестировании с участием 270 экспертов Hy3 набрала 2.67 из 4, превзойдя GLM-5.1 (2.51), особенно в задачах фронтенд-разработки и CI/CD.

Бенчмарк Результат Hy3
SWE-Bench Verified 78.0
SWE-Bench Pro 57.9
GPQA Diamond 90.4
USAMO 2026 72.0
Terminal-Bench 2.1 71.7

Сравнение с GLM-5.2: Компромисс размера и точности

В сравнении с более крупной моделью GLM-5.2 (~744B параметров, ~40B активных), Hy3 уступает в абсолютных показателях по коду, но предлагает значительно меньший отпечаток памяти. Это делает Hy3 более привлекательной для самостоятельного хостинга (self-hosting) и снижения затрат на GPU. GLM-5.2 лидирует в SWE-Bench (84.2 против 78.0), однако Hy3 сохраняет конкурентоспособность при активации в 2 раза меньшего числа параметров.

Метрика Hy3 (21B active) GLM-5.2 (~40B active)
SWE-Bench Verified 78.0 84.2
SWE-Bench Multilingual 75.8 83.0
Terminal-Bench 2.1 71.7 81.0
DeepSWE 28.0 46.2

Деплой и доступность

Hy3 доступна через OpenAI-совместимый API. Для локального развертывания рекомендуются фреймворки vLLM или SGLang с поддержкой MTP. Минимальная конфигурация для инференса — 8 GPU (например, H20-3e). Tencent также выпустила версию Hy3-FP8 для снижения требований к памяти. Модель можно протестировать бесплатно через OpenRouter (до 21 июля 2026 года) или скачать веса с Hugging Face.

Бенчмарки

БенчмаркHy3GLM-5.2
SWE-Bench Verified78%84.2%
SWE-Bench Multilingual75.8%83%
Terminal-Bench 2.171.7%81%
DeepSWE28%46.2%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗