Главная/Блог/Гайд/Kimi K3: Открытая модель на 2.8 трлн…
Гайд8 мин чтения · 17 июля 2026 г.

Kimi K3: Открытая модель на 2.8 трлн параметров с 1 млн токенов

Moonshot AI представила Kimi K3 — первую открытую модель класса 3T с архитектурой MoE, 1-миллионным контекстом и уникальными оптимизациями для длинных последовательностей.

Kimi K3: Открытая модель на 2.8 трлн параметров с 1 млн токенов

В мире искусственного интеллекта, где гонка за параметрами и эффективностью не затихает ни на секунду, компания Moonshot AI совершила очередной прорыв. Они выпустили Kimi K3 — модель, которую сами называют первым в мире открытым решением класса 3 трлн параметров. Это не просто еще одна большая языковая модель; это архитектурный сдвиг, направленный на решение одной из самых болезненных проблем современных ИИ — работы с огромными объемами контекста без потери скорости и качества.

Kimi K3 обладает нативным зрением и поддерживает контекстное окно объемом в 1 миллион токенов. Для понимания масштаба: это эквивалент чтения сотен книг или анализа тысяч страниц технической документации за один раз. Moonshot позиционирует эту модель как инструмент для сложных задач, требующих глубокого анализа, долгосрочного программирования и рассуждений. В этой статье мы подробно разберем, как устроена эта архитектура, какие инновации лежат в ее основе, как она показывает себя на бенчмарках и что это значит для разработчиков и исследователей, особенно в условиях доступа из России.

01Что такое Kimi K3 и почему это важно?

Kimi K3 — это разреженная модель типа Mixture-of-Experts (MoE). В отличие от плотных моделей, где каждый токен обрабатывается всеми нейронами, MoE активирует только небольшую часть «экспертов» для каждой задачи. В случае с Kimi K3, из 896 доступных экспертов активно используется лишь 16. Это позволяет модели иметь колоссальный размер в 2.8 трлн параметров, но при этом сохранять вычислительную эффективность, недостижимую для традиционных архитектур.

Команда Moonshot отмечает, что в течение девяти из последних двенадцати месяцев модели Kimi устанавливали верхнюю границу размера открытых моделей. Kimi K3 продолжает эту традицию, становясь первым открытым представителем класса 3T. Однако важно сразу обозначить контекст: общая производительность K3 пока еще уступает самым мощным проприетарным моделям, таким как Claude Fable 5 и GPT 5.6 Sol. Тем не менее, в собственной оценочной системе Moonshot, K3 стабильно превосходит другие протестированные модели, что говорит о высокой эффективности именно их архитектуры.

💡
Ключевая особенность. Kimi K3 — это не просто «больше параметров». Это модель, спроектированная с нуля для работы с миллионами токенов, где скорость декодирования и управление памятью являются приоритетами наравне с точностью ответов.

02Архитектурные инновации: KDA и AttnRes

Сердце Kimi K3 бьется благодаря двум главным архитектурным обновлениям: Kimi Delta Attention (KDA) и Attention Residuals (AttnRes). Эти механизмы кардинально меняют то, как информация течет через длину последовательности и глубину модели.

Kimi Delta Attention (KDA): Гибридная линейная внимательность

KDA — это гибридный механизм линейной внимательности. Традиционные механизмы внимания (как в стандартных Transformer) имеют квадратичную сложность от длины контекста, что делает обработку миллионов токенов крайне дорогой. KDA решает эту проблему, обеспечивая до 6.3-кратного ускорения декодирования в контекстах длиной в миллион токенов. Это критически важно для приложений, где нужно быстро реагировать на длинные вводные данные, такие как анализ огромных баз кода или юридических документов.

Attention Residuals (AttnRes): Оптимизация глубины

Kimi K3: Открытая модель на 2.8 трлн параметров с 1 млн токенов

Если KDA работает с длиной последовательности, то AttnRes оптимизирует глубину модели. Он избирательно извлекает представления (representations) на разных слоях, вместо того чтобы накапливать их равномерно. По заявлениям Moonshot, это дает примерно 25% повышение эффективности обучения при дополнительных затратах менее 2%. Это позволяет модели учиться быстрее и дешевле, что является огромным преимуществом для открытых сообществ.

Визуализация архитектуры или рекламный баннер, связанный с моделью Vibe2 или Kimi K3.
Визуализация архитектуры или рекламный баннер, связанный с моделью Vibe2 или Kimi K3.

03Управление разреженностью и обучение

Третьим ключевым рычагом является управление разреженностью. Kimi K3 использует Stable LatentMoE. Основная сложность в таких моделях — маршрутизация и оптимизация. Чтобы решить проблему гистерезиса и чувствительности к гиперпараметрам балансировки, Moonshot внедрила Quantile Balancing. Этот метод выводит распределение экспертов напрямую из квантилей оценок маршрутизатора, устраняя необходимость в эвристических обновлениях.

Дополнительно используется Per-Head Muon, который расширяет оптимизатор Muon, позволяя оптимизировать головы внимания независимо. Также применяются Sigmoid Tanh Unit (SiTU) для контроля активаций и Gated MLA для повышения избирательности внимания. В совокупности с улучшенными рецептами обучения и данными, эти структурные изменения дают примерно 2.5-кратное улучшение общей эффективности масштабирования по сравнению с предыдущей версией Kimi K2.

⚠️
Важно для разработчиков. Из-за специфики KDA, стандартное кэширование префиксов (prefix caching) сталкивается с новыми вызовами. Moonshot уже внесла реализацию для решения этой проблемы в библиотеку vLLM, что упрощает развертывание модели для сторонних разработчиков.

04Производительность: Где Kimi K3 сияет, а где отстает

Давайте посмотрим на цифры. Все результаты Kimi K3 получены при максимальном усилии рассуждения (reasoning effort set to max). Важно отметить, что бенчмарки используют разные harnesses: KimiCode, Claude Code или Codex, что может влиять на сравнимость, но дает общее представление о возможностях.

Бенчмарк Kimi K3 Fable 5 (w/ fallback) GPT 5.6 Sol Opus 4.8 GLM-5.2
DeepSWE 67.5 70.0 73.0 59.0 46.2
Program Bench 77.8 76.8 77.6 71.9 63.7
Terminal Bench 2.1 88.3 84.6 88.8 84.6 82.7
FrontierSWE 81.2 86.6 71.3 66.7 67.3
SWE Marathon 42.0 35.0 39.0 40.0 13.0
BrowseComp 91.2 88.0 90.4 84.3
Automation Bench 30.8 29.1 29.7 27.2 12.9
GPQA-Diamond 93.5 92.6 94.1 91.0 91.2
HLE-Full 43.5 53.3 44.5 49.8
MMMU-Pro 81.6 81.2 83.0 78.9
OmniDocBench 91.1 89.8 85.8 87.9

Обратите внимание на два важных нюанса. Во-первых, пометка «with fallback» для Fable 5 означает, что запросы, отклоненные политикой использования этой модели, перенаправляются в Opus 4.8. Во-вторых, в BrowseComp использовалось сжатие контекста, срабатывающее при достижении 300K токенов. Без этого управления контекстом результат K3 составил бы 90.4.

Таким образом, Kimi K3 лидирует в Program Bench, SWE Marathon, BrowseComp, Automation Bench и OmniDocBench. Это указывает на сильную специализацию в программировании, автоматизации и работе с документами. Однако она уступает Fable 5 в FrontierSWE и HLE-Full, а также GPT 5.6 Sol в DeepSWE. Это честная картина: модель не универсальный чемпион, но мощный инструмент для конкретных, сложных задач.

05Практическое применение: От кода до исследований

Архитектура Kimi K3 открывает двери для уникальных сценариев использования. Поскольку это единая мультимодальная архитектура, она обрабатывает текст, изображения и видео вместе. Вот несколько примеров:

Kimi K3: Открытая модель на 2.8 трлн параметров с 1 млн токенов
  • Инженерия на уровне репозитория: Долгие сессии с минимальным человеческим контролем. Модель может анализировать весь код проекта, используя Kimi Code или /model.
  • Зрение в цикле (Vision in the loop): Итеративная работа между кодом и живыми скриншотами. Это полезно для тестирования UI/UX, где модель видит интерфейс и пишет код для его изменения.
  • Воспроизведение исследований: Пример с отношениями I–Love–Q, где модель проанализировала более 20 научных статей и написала 3000+ строк кода на Python, используя 1M контекст и автоматическое кэширование.
  • Глубокие исследовательские отчеты: Анализ 42-летнего исследования ASIC, включающего более 2800 запросов и 11000+ страниц документов, через Kimi Work и виджеты.
  • Парсинг документов: Высокий балл в OmniDocBench (91.1) благодаря нативному зрению и структурированному выводу.

06Доступ, API и цены: Реалии для разработчиков

Kimi K3 доступна на Kimi.com, в Kimi Work, Kimi Code и через API. Доступ осуществляется через OpenAI SDK, что делает интеграцию максимально простой для тех, кто уже знаком с экосистемой OpenAI. Базовый URL для Moonshot — https://api.moonshot.ai/v1.

terminalpython
from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1"
)

completion = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="max",
    messages=[
        {"role": "user", "content": "Introduce Kimi K3 in one sentence."}
    ]
)

print(completion.choices[0].message.content)

При использовании API есть несколько строгих правил:

  1. reasoning_effort: Поддерживается только значение max. Параметр thinking от K2.x использовать нельзя.
  2. temperature и top_p: Эти параметры зафиксированы, поэтому их нужно опускать в запросе.
  3. max_completion_tokens: По умолчанию 131072, но может достигать 1048576. В многошаговых диалогах и вызовах инструментов нужно возвращать полное сообщение ассистента.
📌
Ценообразование. Цены плоские, без тарификации по длине контекста. Кэш-хит (вводные данные, уже находящиеся в кэше) стоит $0.30/MTok, кэш-мисс — $3.00/MTok, а вывод — $15.00/MTok. Moonshot сообщает, что уровень кэш-хитов в задачах программирования превышает 90%, что делает использование модели экономически выгодным.

07Что это значит на практике

Для разработчиков из России и других стран, где доступ к некоторым западным сервисам ограничен, Kimi K3 представляет большой интерес. Во-первых, это открытая модель с огромным контекстом, что позволяет запускать ее локально или на собственных серверах, если у вас есть доступ к достаточному количеству ускорителей (Moonshot рекомендует конфигурации supernode с 64+ ускорителями). Во-вторых, совместимость с OpenAI SDK означает, что миграция с существующих проектов минимальна.

Высокие баллы в программировании и работе с документами делают Kimi K3 отличным выбором для автоматизации рутинных инженерных задач, анализа технической документации и создания интеллектуальных помощников, которые могут «прочитать» весь ваш проект. Однако, для задач, требующих высочайшего уровня общих знаний или сложных логических рассуждений вне специализированных областей, проприетарные лидеры пока остаются вне конкуренции.

В заключение, Kimi K3 — это не просто еще одна модель. Это демонстрация того, как архитектурные инновации (KDA, AttnRes, Stable LatentMoE) могут преодолеть ограничения масштабируемости. Для сообщества открытого ИИ это важный шаг к созданию моделей, которые не уступают закрытым аналогам в специфических, но критически важных задачах.

Источник: MarkTechPost ↗