Релиз модели28 июля 2026 г., 10:16 МСК🤖 Auto

Kimi K3: 2.8 трлн параметров, но активны лишь 1.8% — разбор архитектуры

Moonshot AI опубликовала веса модели Kimi K3 с 2.8 триллионами параметров. Несмотря на масштаб, архитектура MoE обеспечивает эффективность за счет активации малого процента весов.

Баннер новости 4522

Масштаб и доступность

27 июля в 00:00 UTC компания Moonshot AI выложила веса своей новой модели Kimi K3 на платформу Hugging Face. Ключевая характеристика, которую цитируют все источники, — объем параметров: 2.8 триллиона. Это ставит Kimi K3 в один ряд с крупнейшими языковыми моделями в мире, предлагая открытый доступ к весам, что критически важно для исследователей и разработчиков, стремящихся к прозрачности и кастомизации.

Архитектура: почему 2.8 трлн — это не барьер

Главная интрига заключается в цифре 1.8%. Несмотря на колоссальный размер модели, в каждый момент времени активны ("fire") лишь 1.8% от общего числа параметров. Это классический пример архитектуры Mixture of Experts (MoE), где вычислительная нагрузка распределяется между узкими специализированными блоками. Такая конструкция позволяет модели обладать огромной базой знаний и сложностью рассуждений, сохраняя при этом приемлемую скорость инференса и затраты на энергию.

Сравнение с предыдущими поколениями

Для понимания масштаба прорыва важно сопоставить Kimi K3 с ее предшественниками и конкурентами. Переход к 2.8 трлн параметров знаменует собой качественный скачок в способности модели обрабатывать сложные контексты и мультимодальные задачи.

Модель Общее число параметров Активные параметры (примерно) Архитектура
Kimi K3 2.8 Trillion ~1.8% (Dynamic) MoE (Mixture of Experts)
Kimi K2 (предшественник) 1.0 Trillion ~1.8% (Dynamic) MoE
Standard Dense Models (напр. Llama 3 70B) 70 Billion 100% Dense

Почему это важно для индустрии

Открытие весов Kimi K3 позволяет сообществу:

  • Проводить независимый аудит: Проверять безопасность, предвзятость и надежность модели на данных объемах.
  • Оптимизировать инференс: Разрабатывать новые методы квантования и сжатия для MoE-архитектур, что может снизить требования к GPU для запуска подобных гигантов.
  • Исследовать пределы масштабируемости: Изучать, как рост числа параметров до триллионного уровня влияет на способность к логическому выводу и работе с длинными контекстами.

Заключение

Публикация Kimi K3 — это не просто еще одна модель в списке Hugging Face. Это демонстрация того, что архитектура MoE позволяет обходить традиционные ограничения вычислительной сложности, делая модели с триллионами параметров практически применимыми. Следующим шагом станет анализ реальных бенчмарков и производительности на открытых весах.

Источник: Towards AI pub ↗