Архитектурный прорыв: KDA и AttnRes
Kimi K3 — это разреженная модель Mixture-of-Experts (MoE) с 2.8 триллионами параметров, из которых активны только 16 из 896 экспертов. Ключевые инновации Moonshot AI включают Kimi Delta Attention (KDA) — гибридный механизм линейного внимания, ускоряющий декодирование в 6.3 раза в длинных контекстах, и Attention Residuals (AttnRes), повышающие эффективность обучения на 25% при минимальных накладных расходах. Общая эффективность масштабирования улучшена в 2.5 раза по сравнению с предшественником K2.
Производительность: лидер в коде, аутсайдер в сложных рассуждениях
Модель демонстрирует выдающиеся результаты в задачах программирования и работы с документами, но уступает флагманским проприетарным моделям в сложных логических тестах. Ниже приведено сравнение ключевых бенчмарков (с максимальным усилием рассуждения):
| Бенчмарк | Kimi K3 | Fable 5 (w/ fallback) | GPT 5.6 Sol | Opus 4.8 |
|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 |
Доступность и ценообразование
Модель доступна через API, совместимый с OpenAI SDK, с поддержкой контекста до 1 048 576 токенов. Moonshot предлагает фиксированное ценообразование без градации по длине контекста:
- Кэш-хит (входные данные): $0.30 за миллион токенов (MTok).
- Кэш-мисс (входные данные): $3.00 за MTok.
- Генерация (выходные данные): $15.00 за MTok.
Компания отмечает, что в задачах программирования уровень попадания в кэш превышает 90%, что делает использование модели экономически выгодным. Для оптимизации работы с KDA Moonshot также внесла изменения в библиотеку vLLM.
Бенчмарки
| Бенчмарк | Kimi K3 | Fable 5 (w/ fallback) | GPT 5.6 Sol | Opus 4.8 |
|---|---|---|---|---|
| DeepSWE | 67.5% | 70% | 73% | 59% |
| Program Bench | 77.8% | 76.8% | 77.6% | 71.9% |
| Terminal Bench 2.1 | 88.3% | 84.6% | 88.8% | 84.6% |
| FrontierSWE | 81.2% | 86.6% | 71.3% | 66.7% |
| SWE Marathon | 42% | 35% | 39% | 40% |
| BrowseComp | 91.2% | 88% | 90.4% | 84.3% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
