Главная/Блог/Разбор/Tencent Hy3: 295B MoE модель с 256K…
Разбор3 мин чтения · 7 июля 2026 г.

Tencent Hy3: 295B MoE модель с 256K контекстом и FP8 квантованием

Tencent представила Hy3 — мощную MoE-модель на 295B параметров с 256K контекстом. Разбираем требования к VRAM, доступность через OpenRouter и практическое применение.

Tencent Hy3: 295B MoE модель с 256K контекстом и FP8 квантованием

Tencent Hy Team выпустила новую модель Hy3 с лицензией Apache 2.0. Это Mixture-of-Experts (MoE) архитектура, которая демонстрирует результаты, сопоставимые с флагманскими закрытыми моделями, но при этом имеет открытый вес. Модель позиционируется как решение для сложных задач продуктивности и генерации, превосходя аналоги схожего размера в 2-5 раз по параметрам.

01Архитектура и ключевые характеристики

Hy3 использует эффективную структуру MoE, что позволяет обрабатывать огромные объемы данных при меньших вычислительных затратах на инференс. Ключевые технические параметры:

  • Общее число параметров: 295 Billion (295B).
  • Активные параметры: 21 Billion (21B) на каждый шаг генерации. Это критически важно для скорости инференса.
  • Параметры MTP (Multi-Token Prediction): 3.8B. Эта прослойка помогает предсказывать несколько токенов одновременно, ускоряя генерацию.
  • Контекстное окно: 256K токенов. Позволяет загружать огромные документы или длинные диалоги.
💡
Почему это важно для практиков. Активные параметры (21B) определяют нагрузку на GPU в момент времени, а не общий размер модели. Это значит, что для запуска можно использовать модели с меньшим объемом VRAM, чем требуется для плотных моделей такого же общего размера, но за счет активации разных экспертных слоев.

02Размеры весов и требования к памяти (VRAM)

Для локального запуска необходимо учитывать два основных формата весов. Разница в объеме памяти между ними существенна, что диктует выбор оборудования.

Формат Размер на диске Примерная VRAM (FP16/BF16) Примерная VRAM (INT8/INT4)
Full Precision (FP16/BF16) 598 GB ~600-650 GB ~300-350 GB
FP8 Quantized 300 GB ~300-320 GB ~150-180 GB

Для запуска полной версии в FP16 потребуется кластер из 8x A100/H100 (80GB) или эквивалент. FP8 версия снижает порог входа, но все равно требует серьезного серверного железа. Для домашних условий или небольших серверов эта модель доступна только через API или в сильно квантованном виде (INT4/INT8), если такие сборки появятся в сообществе.

⚠️
Важно про VRAM. При использовании 256K контекста объем памяти, занимаемый KV-cache, может стать узким местом. Убедитесь, что у вас есть запас VRAM сверх размера весов модели, особенно если вы работаете с длинными документами.

03Доступность и тестирование

На момент релиза (июль 2026 года) Tencent предоставляет бесплатный доступ к модели через агрегатор OpenRouter до 21 июля. Это отличная возможность протестировать возможности модели без затрат на инфраструктуру.

Пример использования через API OpenRouter (генерация SVG по запросу):

terminalbash
curl https://openrouter.ai/api/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -d '{
    "model": "tencent/hy3",
    "messages": [
      {
        "role": "user",
        "content": "Generate an SVG of a pelican riding a bicycle"
      }
    ]
  }'

Результаты тестов показывают, что Hy3 справляется с генерацией кода, сложными логическими задачами и креативными заданиями на уровне флагманских моделей. Особый акцент сделан на улучшении качества после сбора фидбека от 50+ продуктов-партнеров.

04Локальный запуск: инструменты

Для работы с такими большими моделями рекомендуется использовать vLLM или Text Generation Inference (TGI), так как они эффективно управляют памятью и поддерживают PagedAttention для длинных контекстов.

Пример команды запуска через vLLM (предполагается наличие FP8 весов и кластера GPU):

terminalbash
python -m vllm.entrypoints.api_server \
  --model tencent/Hy3 \
  --tensor-parallel-size 8 \
  --dtype float8 \
  --max-model-len 256000 \
  --gpu-memory-utilization 0.95

Если вы используете llama.cpp для квантованных версий (GGUF), убедитесь, что ваша сборка поддерживает MP (Multi-Processing) и имеет достаточную поддержку CUDA/HIP для распределения слоев по нескольким GPU.

05Кому подойдёт / что запустится

  • Enterprise и Research: Идеально для задач, требующих понимания длинных контекстов (256K) и сложной логики. Замена закрытым моделям в корпоративных средах.
  • Инфраструктура: Требует минимум 8 GPU (A100/H100/H800) для FP16/FP8 версий. Для INT4 квантования возможно запуск на 4-6 GPU, но с компромиссом в качестве.
  • Разработчики: Доступен через API (OpenRouter) для интеграции в продукты. Лицензия Apache 2.0 позволяет коммерческое использование без ограничений.
  • Домашние пользователи: Не подходит для локального запуска на потребительском железе из-за огромных требований к памяти. Рекомендуется использовать через облачные провайдеры.

Модель Hy3 демонстрирует, что MoE-архитектуры с активными параметрами ~20B могут конкурировать с плотными моделями в 100B+ параметров, предлагая баланс между скоростью и качеством.

Источник: Simon Willison ↗