Технические характеристики и архитектура
Moonshot AI представила Kimi K3, модель, которая стала самым близким к уровню «фронтера» (frontier) открытым весом с начала 2025 года. Архитектура использует Mixture-of-Experts (MoE): 2.8 триллиона общих параметров, из которых активными для каждого токена обрабатываются 16 из 896 экспертов. Ключевые особенности:
- Контекст: 1 миллион токенов.
- Мультимодальность: нативная поддержка зрения (vision).
- Оптимизация: Attention Residuals (извлечение выходов предыдущих слоев) повысила эффективность обучения на 25% при росте затрат менее чем на 2%.
- Квантование: обучение с учетом квантования в формате MXFP4 (4 бита).
Бенчмарки: где K3 лидирует, а где отстает
По данным Artificial Analysis (на 21 июля 2026 года), Kimi K3 занимает уверенное место в топ-3, уступая лишь Claude Fable 5 и GPT-5.6 Sol. Однако в специфических задачах, таких как программирование и автономные агенты, K3 демонстрирует выдающиеся результаты.
| Метрика / Платформа | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Opus 4.8 |
|---|---|---|---|---|
| Intelligence Index | 57.11 | 59.86 | 58.89 | 55.69 |
| Coding Index | 76.24 | ~76.00 | ~76.00 | — |
| Arena Frontend Leaderboard | 1,679 Elo (1 место) | — | — | — |
| AA-Omniscience (знания) | 18 | 40 | — | 27 |
Экономика и производительность
Несмотря на высокие показатели, Kimi K3 имеет серьезные недостатки в скорости и стоимости инференса. Модель генерирует на 54% больше токенов вывода, что нивелирует экономию на цене за токен.
- Скорость: 39.5 токенов в секунду. Время ответа на стандартный запрос (500 токенов) — 67.5 секунд. Однако первый токен рассуждения появляется через ~4 секунды (в отличие от 2 минут у конкурентов в режиме максимальных усилий).
- Стоимость: $0.95 за задачу в Intelligence Index (на 8% дешевле Sol). Затраты на инференс в 3 раза выше, чем у предшественника Kimi 2.6.
- Требования к железу: для развертывания требуется минимум 64 ускорителя. Размер весов в MXFP4 — ~1.5 ТБ.
Почему это важно: рекурсия и геополитика AI
Запуск K3 подчеркивает три ключевых тренда:
- Рекурсивное улучшение: Kimi K3 не просто обучена на данных, она сама оптимизировала ядро Attention Residuals и разработала компилятор MiniTriton. Агенты начинают проектировать архитектуру своих преемников.
- Стирание границ: Китайские лаборатории (Moonshot, Zhipu) демонстрируют архитектурные инновации, компенсирующие отставание в доступе к чипам и вычислительным мощностям. Интеллект «фронтера» распространяется через дистилляцию и синтетические данные, делая передовые модели доступнее.
- Дефицит мощностей: Спрос на K3 превысил предложение, заставив Moonshot приостановить новые подписки. Это доказывает, что инференс-мощности становятся главным ограничивающим фактором для внедрения, а не только доступ к весам моделей.
Бенчмарки
| Бенчмарк | Kimi K3 | Kimi K3 Thinking | Claude Fable 5 | Fable 5 | GPT-5.6 Sol | K2.6 | Opus 4.8 |
|---|---|---|---|---|---|---|---|
| Artificial Analysis Intelligence Index | 57.11score | — | 59.86score | — | 58.89score | — | 55.69score |
| AA-Omniscience | 18score | — | 40score | — | — | — | 27score |
| K3 Thinking | — | 2840Elo | — | 2760Elo | — | 2214Elo | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Towards AI newsletter ↗
