Архитектура и ключевые характеристики
Hy3 — это разреженная модель типа Mixture-of-Experts (MoE) с общим объемом 295 миллиардов параметров. Ключевая особенность архитектуры: использование 192 экспертов с маршрутизацией top-8. Это означает, что для обработки каждого токена задействуется только 8 экспертов, что снижает вычислительные затраты. Модель поддерживает контекстное окно до 256K токенов и включает слой Multi-Token Prediction (MTP) объемом 3.8B параметров для ускорения декодирования через спекулятивный вывод.
| Параметр | Значение |
|---|---|
| Общее число параметров | 295B |
| Активные параметры на токен | 21B |
| Количество экспертов | 192 (активируется 8) |
| Длина контекста | 256K токенов |
| Размер словаря | 120,832 |
| Лицензия | Apache 2.0 |
Результаты бенчмарков: Код, STEM и надежность
Модель демонстрирует сильные результаты в задачах программирования и сложных рассуждений. Особое внимание разработчики уделили стабильности работы с инструментами (tool calling) и снижению галлюцинаций. Внутренние тесты показали снижение уровня галлюцинаций с 12.5% до 5.4%, а ошибок здравого смысла — с 25.4% до 12.7%. В слепом тестировании с участием 270 экспертов Hy3 набрала 2.67 из 4, превзойдя GLM-5.1 (2.51), особенно в задачах фронтенд-разработки и CI/CD.
| Бенчмарк | Результат Hy3 |
|---|---|
| SWE-Bench Verified | 78.0 |
| SWE-Bench Pro | 57.9 |
| GPQA Diamond | 90.4 |
| USAMO 2026 | 72.0 |
| Terminal-Bench 2.1 | 71.7 |
Сравнение с GLM-5.2: Компромисс размера и точности
В сравнении с более крупной моделью GLM-5.2 (~744B параметров, ~40B активных), Hy3 уступает в абсолютных показателях по коду, но предлагает значительно меньший отпечаток памяти. Это делает Hy3 более привлекательной для самостоятельного хостинга (self-hosting) и снижения затрат на GPU. GLM-5.2 лидирует в SWE-Bench (84.2 против 78.0), однако Hy3 сохраняет конкурентоспособность при активации в 2 раза меньшего числа параметров.
| Метрика | Hy3 (21B active) | GLM-5.2 (~40B active) |
|---|---|---|
| SWE-Bench Verified | 78.0 | 84.2 |
| SWE-Bench Multilingual | 75.8 | 83.0 |
| Terminal-Bench 2.1 | 71.7 | 81.0 |
| DeepSWE | 28.0 | 46.2 |
Деплой и доступность
Hy3 доступна через OpenAI-совместимый API. Для локального развертывания рекомендуются фреймворки vLLM или SGLang с поддержкой MTP. Минимальная конфигурация для инференса — 8 GPU (например, H20-3e). Tencent также выпустила версию Hy3-FP8 для снижения требований к памяти. Модель можно протестировать бесплатно через OpenRouter (до 21 июля 2026 года) или скачать веса с Hugging Face.
Бенчмарки
| Бенчмарк | Hy3 | GLM-5.2 |
|---|---|---|
| SWE-Bench Verified | 78% | 84.2% |
| SWE-Bench Multilingual | 75.8% | 83% |
| Terminal-Bench 2.1 | 71.7% | 81% |
| DeepSWE | 28% | 46.2% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
