Релиз модели17 июля 2026 г., 15:19 МСК🤖 Auto

Kimi K3: 2.8 трлн параметров и победа над Claude в коде

Moonshot AI выпустила Kimi K3 — крупнейшую в мире модель с открытыми весами (2.8 трлн параметров). Она лидирует в Frontend Code Arena, обходя Claude Fable 5, и использует гибридную архитектуру для обхода ограничений вычислений.

Баннер новости 3814

Рекорд открытого веса и архитектура

Китайская лаборатория Moonshot AI представила Kimi K3, которую называет первой в мире системой класса 3T с открытыми весами. Модель обладает контекстным окном в 1 миллион токенов, нативным зрением и использует MoE-архитектуру: из 896 экспертов активируется лишь 16 на токен (около 1.8%). Полные веса станут доступны 27 июля, что позволит независимым исследователям верифицировать заявления компании.

Бенчмарки: победа в коде

В слепом тестировании разработчиков Kimi K3 заняла первое место в Frontend Code Arena, набрав 1679 баллов. Это позволило модели подняться с 18-го места (у K2.6) на вершину рейтинга, опередив Anthropic Claude Fable 5. Модель также показала лучшие результаты в 6 из 7 доменов фронтенд-разработки.

Метрика / Модель Результат / Характеристика
Kimi K3 (Moonshot) 1679 баллов (Frontend Code Arena, #1)
Claude Fable 5 (Anthropic) Ниже K3 (второе место в тесте)
Контекстное окно 1 000 000 токенов
Активные параметры 1.8% от общего пула (16 из 896 экспертов)
Улучшение к K2 Рост на 17 позиций в рейтинге

Экономия и цены API

Ключевым преимуществом K3 стала эффективность масштабирования, улучшенная в 2.5 раза по сравнению с K2 за счет архитектурных инноваций: Kimi Delta Attention (гибридная линейная схема) и Attention Residuals. Для совместимости с разным оборудованием используется квантование MXFP4/MXFP8.

Стоимость API для K3 значительно выше, чем у предшественника из-за отсутствия кэширования:

  • Кэш-хит (ввод): $0.30 за 1 млн токенов.
  • Кэш-мисс (ввод): $3.00 за 1 млн токенов (в 5 раз дороже K2).
  • Генерация (вывод): $15.00 за 1 млн токенов.

Обход санкций и кейс с чипами

Несмотря на ограничения США на поставки чипов, Moonshot оптимизировала K3 для Nvidia H200 и альтернативных GPGPU, используя собственный компилятор MiniTriton. В демонстрационном кейсе модель за 48 часов автономной работы спроектировала inference-чип для нано-модели, который закрыл тайминги на 100 МГц, содержал 1.46 млн стандартных ячеек и обеспечивал более 8700 токенов/сек.

Контекст и споры

Аналитики Bank of America отмечают, что K3 доказывает: даже при дефиците вычислений архитектурные решения могут давать прорывные результаты. Однако Anthropic ранее обвиняла Moonshot в использовании 3.4 млн запросов Claude для дистилляции знаний, что вызывает вопросы о чистоте обучения, так как результаты K3 близки к заявленным Anthropic моделям.

Бенчмарки

БенчмаркKimi K3Claude Fable 5
Frontend Code Arena1679points0points

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Tom's Hardware ↗