Tencent Hy Team выпустила новую модель Hy3 с лицензией Apache 2.0. Это Mixture-of-Experts (MoE) архитектура, которая демонстрирует результаты, сопоставимые с флагманскими закрытыми моделями, но при этом имеет открытый вес. Модель позиционируется как решение для сложных задач продуктивности и генерации, превосходя аналоги схожего размера в 2-5 раз по параметрам.
01Архитектура и ключевые характеристики
Hy3 использует эффективную структуру MoE, что позволяет обрабатывать огромные объемы данных при меньших вычислительных затратах на инференс. Ключевые технические параметры:
- Общее число параметров: 295 Billion (295B).
- Активные параметры: 21 Billion (21B) на каждый шаг генерации. Это критически важно для скорости инференса.
- Параметры MTP (Multi-Token Prediction): 3.8B. Эта прослойка помогает предсказывать несколько токенов одновременно, ускоряя генерацию.
- Контекстное окно: 256K токенов. Позволяет загружать огромные документы или длинные диалоги.
02Размеры весов и требования к памяти (VRAM)
Для локального запуска необходимо учитывать два основных формата весов. Разница в объеме памяти между ними существенна, что диктует выбор оборудования.
| Формат | Размер на диске | Примерная VRAM (FP16/BF16) | Примерная VRAM (INT8/INT4) |
|---|---|---|---|
| Full Precision (FP16/BF16) | 598 GB | ~600-650 GB | ~300-350 GB |
| FP8 Quantized | 300 GB | ~300-320 GB | ~150-180 GB |
Для запуска полной версии в FP16 потребуется кластер из 8x A100/H100 (80GB) или эквивалент. FP8 версия снижает порог входа, но все равно требует серьезного серверного железа. Для домашних условий или небольших серверов эта модель доступна только через API или в сильно квантованном виде (INT4/INT8), если такие сборки появятся в сообществе.
03Доступность и тестирование
На момент релиза (июль 2026 года) Tencent предоставляет бесплатный доступ к модели через агрегатор OpenRouter до 21 июля. Это отличная возможность протестировать возможности модели без затрат на инфраструктуру.
Пример использования через API OpenRouter (генерация SVG по запросу):
curl https://openrouter.ai/api/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-d '{
"model": "tencent/hy3",
"messages": [
{
"role": "user",
"content": "Generate an SVG of a pelican riding a bicycle"
}
]
}'Результаты тестов показывают, что Hy3 справляется с генерацией кода, сложными логическими задачами и креативными заданиями на уровне флагманских моделей. Особый акцент сделан на улучшении качества после сбора фидбека от 50+ продуктов-партнеров.
04Локальный запуск: инструменты
Для работы с такими большими моделями рекомендуется использовать vLLM или Text Generation Inference (TGI), так как они эффективно управляют памятью и поддерживают PagedAttention для длинных контекстов.
Пример команды запуска через vLLM (предполагается наличие FP8 весов и кластера GPU):
python -m vllm.entrypoints.api_server \
--model tencent/Hy3 \
--tensor-parallel-size 8 \
--dtype float8 \
--max-model-len 256000 \
--gpu-memory-utilization 0.95Если вы используете llama.cpp для квантованных версий (GGUF), убедитесь, что ваша сборка поддерживает MP (Multi-Processing) и имеет достаточную поддержку CUDA/HIP для распределения слоев по нескольким GPU.
05Кому подойдёт / что запустится
- Enterprise и Research: Идеально для задач, требующих понимания длинных контекстов (256K) и сложной логики. Замена закрытым моделям в корпоративных средах.
- Инфраструктура: Требует минимум 8 GPU (A100/H100/H800) для FP16/FP8 версий. Для INT4 квантования возможно запуск на 4-6 GPU, но с компромиссом в качестве.
- Разработчики: Доступен через API (OpenRouter) для интеграции в продукты. Лицензия Apache 2.0 позволяет коммерческое использование без ограничений.
- Домашние пользователи: Не подходит для локального запуска на потребительском железе из-за огромных требований к памяти. Рекомендуется использовать через облачные провайдеры.
Модель Hy3 демонстрирует, что MoE-архитектуры с активными параметрами ~20B могут конкурировать с плотными моделями в 100B+ параметров, предлагая баланс между скоростью и качеством.
Источник: Simon Willison ↗
