Рекорд открытого веса и архитектура
Китайская лаборатория Moonshot AI представила Kimi K3, которую называет первой в мире системой класса 3T с открытыми весами. Модель обладает контекстным окном в 1 миллион токенов, нативным зрением и использует MoE-архитектуру: из 896 экспертов активируется лишь 16 на токен (около 1.8%). Полные веса станут доступны 27 июля, что позволит независимым исследователям верифицировать заявления компании.
Бенчмарки: победа в коде
В слепом тестировании разработчиков Kimi K3 заняла первое место в Frontend Code Arena, набрав 1679 баллов. Это позволило модели подняться с 18-го места (у K2.6) на вершину рейтинга, опередив Anthropic Claude Fable 5. Модель также показала лучшие результаты в 6 из 7 доменов фронтенд-разработки.
| Метрика / Модель | Результат / Характеристика |
|---|---|
| Kimi K3 (Moonshot) | 1679 баллов (Frontend Code Arena, #1) |
| Claude Fable 5 (Anthropic) | Ниже K3 (второе место в тесте) |
| Контекстное окно | 1 000 000 токенов |
| Активные параметры | 1.8% от общего пула (16 из 896 экспертов) |
| Улучшение к K2 | Рост на 17 позиций в рейтинге |
Экономия и цены API
Ключевым преимуществом K3 стала эффективность масштабирования, улучшенная в 2.5 раза по сравнению с K2 за счет архитектурных инноваций: Kimi Delta Attention (гибридная линейная схема) и Attention Residuals. Для совместимости с разным оборудованием используется квантование MXFP4/MXFP8.
Стоимость API для K3 значительно выше, чем у предшественника из-за отсутствия кэширования:
- Кэш-хит (ввод): $0.30 за 1 млн токенов.
- Кэш-мисс (ввод): $3.00 за 1 млн токенов (в 5 раз дороже K2).
- Генерация (вывод): $15.00 за 1 млн токенов.
Обход санкций и кейс с чипами
Несмотря на ограничения США на поставки чипов, Moonshot оптимизировала K3 для Nvidia H200 и альтернативных GPGPU, используя собственный компилятор MiniTriton. В демонстрационном кейсе модель за 48 часов автономной работы спроектировала inference-чип для нано-модели, который закрыл тайминги на 100 МГц, содержал 1.46 млн стандартных ячеек и обеспечивал более 8700 токенов/сек.
Контекст и споры
Аналитики Bank of America отмечают, что K3 доказывает: даже при дефиците вычислений архитектурные решения могут давать прорывные результаты. Однако Anthropic ранее обвиняла Moonshot в использовании 3.4 млн запросов Claude для дистилляции знаний, что вызывает вопросы о чистоте обучения, так как результаты K3 близки к заявленным Anthropic моделям.
Бенчмарки
| Бенчмарк | Kimi K3 | Claude Fable 5 |
|---|---|---|
| Frontend Code Arena | 1679points | 0points |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Tom's Hardware ↗
