Релиз модели2 августа 2026 г., 03:00 МСК🤖 Auto

Kimi K3: 2.8 трлн параметров и битва с GPT-5.6

Moonshot AI выпустила Kimi K3 — крупнейшую в мире открытую модель с 2.8 триллионами параметров. Together AI объявила о прямой интеграции, позиционируя K3 как конкурента GPT-5.6 и Claude 5.

Баннер новости 4895

Рекорд масштаба и позиционирование

Kimi K3 от Moonshot AI официально стала самой большой открытой моделью (open-weight) в истории. Архитектура насчитывает 2.8 триллиона параметров, что позволяет ей конкурировать с закрытыми флагманами уровня GPT 5.6 Sol и Claude 5. Together AI, выступая прямым партнером Moonshot, уже развернула модель на своей инфраструктуре в США, обеспечив полную совместимость с OpenAI API и поддержку контекстного окна до 1 миллиона токенов.

Архитектурные инновации: KDA и Stable LatentMoE

Мощность K3 обеспечивается не только количеством параметров, но и новыми механизмами обработки данных. Ключевые компоненты:

  • Kimi Delta Attention (KDA): гибридный линейный механизм внимания, впервые позволяющий работать с контекстом в 1M токенов без потери эффективности.
  • Attention Residuals (AttnRes): выборочное извлечение представлений по глубине сети, а не их равномерное накопление.
  • Stable LatentMoE: архитектура Mixture-of-Experts, где из 896 экспертов для каждого токена активируется всего 16 (около 2%). Это требует сложных техник балансировки, таких как Quantile Balancing и Per-Head Muon optimizer.

Сравнение возможностей и бенчмарки

Модель позиционируется как лидер в задачах долгосрочного программирования (long-horizon coding) и глубокого рассуждения. Ниже приведена сводка ключевых характеристик Kimi K3:

Параметр Значение / Характеристика
Количество параметров 2.8 триллиона (2.8T)
Архитектура Stable LatentMoE (16/896 экспертов)
Макс. контекст 1,000,000 токенов
Мультимодальность Vision (до 4K, без лимита на кол-во, до 100MB)
Режимы рассуждения low, high, max (по умолчанию max)
Совместимость API OpenAI-compatible (Together Python SDK)

Интеграция и стоимость

Для разработчиков доступна официальная интеграция через Together AI. Модель поддерживает стриминг с разделением токенов рассуждения (reasoning_content) и ответа, а также строгий вывод в формате JSON через response_format. Важно учитывать, что при использовании режима рассуждения (reasoning_effort) токены «мышления» потребляют лимит max_tokens, поэтому для сложных задач требуется generous cap.

Модель доступна для тестирования в Playground Together AI и готова к продакшену. Стоимость инференса зависит от выбранного тарифа Together AI, но модель предлагает высокую плотность знаний за счет эффективной маршрутизации экспертов.

Источник: Together AI ↗