Рекорд масштаба и позиционирование
Kimi K3 от Moonshot AI официально стала самой большой открытой моделью (open-weight) в истории. Архитектура насчитывает 2.8 триллиона параметров, что позволяет ей конкурировать с закрытыми флагманами уровня GPT 5.6 Sol и Claude 5. Together AI, выступая прямым партнером Moonshot, уже развернула модель на своей инфраструктуре в США, обеспечив полную совместимость с OpenAI API и поддержку контекстного окна до 1 миллиона токенов.
Архитектурные инновации: KDA и Stable LatentMoE
Мощность K3 обеспечивается не только количеством параметров, но и новыми механизмами обработки данных. Ключевые компоненты:
- Kimi Delta Attention (KDA): гибридный линейный механизм внимания, впервые позволяющий работать с контекстом в 1M токенов без потери эффективности.
- Attention Residuals (AttnRes): выборочное извлечение представлений по глубине сети, а не их равномерное накопление.
- Stable LatentMoE: архитектура Mixture-of-Experts, где из 896 экспертов для каждого токена активируется всего 16 (около 2%). Это требует сложных техник балансировки, таких как Quantile Balancing и Per-Head Muon optimizer.
Сравнение возможностей и бенчмарки
Модель позиционируется как лидер в задачах долгосрочного программирования (long-horizon coding) и глубокого рассуждения. Ниже приведена сводка ключевых характеристик Kimi K3:
| Параметр | Значение / Характеристика |
|---|---|
| Количество параметров | 2.8 триллиона (2.8T) |
| Архитектура | Stable LatentMoE (16/896 экспертов) |
| Макс. контекст | 1,000,000 токенов |
| Мультимодальность | Vision (до 4K, без лимита на кол-во, до 100MB) |
| Режимы рассуждения | low, high, max (по умолчанию max) |
| Совместимость API | OpenAI-compatible (Together Python SDK) |
Интеграция и стоимость
Для разработчиков доступна официальная интеграция через Together AI. Модель поддерживает стриминг с разделением токенов рассуждения (reasoning_content) и ответа, а также строгий вывод в формате JSON через response_format. Важно учитывать, что при использовании режима рассуждения (reasoning_effort) токены «мышления» потребляют лимит max_tokens, поэтому для сложных задач требуется generous cap.
Модель доступна для тестирования в Playground Together AI и готова к продакшену. Стоимость инференса зависит от выбранного тарифа Together AI, но модель предлагает высокую плотность знаний за счет эффективной маршрутизации экспертов.
Источник: Together AI ↗
