Крупнейшая открытая MoE-модель Kimi K3
В рамках стратегического партнерства Together AI становится стартовой площадкой для релизов Moonshot AI. Первой моделью стала Kimi K3 — 2.8-триллионная параметровая разреженная модель архитектуры Mixture-of-Experts (MoE). Ключевые характеристики:
- Контекстное окно: 1 000 000 токенов.
- Мультимодальность: нативная поддержка зрения (vision).
- Архитектурные новинки: Kimi Delta Attention (KDA) для ускорения декодирования на длинных последовательностях и Attention Residuals (AttnRes) для улучшения извлечения представлений.
- Эффективность: оптимизаторы (per-head Muon, балансировка нагрузки) обеспечивают рост эффективности масштабирования в ~2.5 раза по сравнению с Kimi K2.
Производственная инфраструктура и SLA
Разработчики получают доступ к Kimi K3 через три продукта Together AI, что позволяет перейти от прототипа к продакшену без смены провайдера:
- Serverless: для быстрого итеративного тестирования.
- Provisioned Throughput: зарезервированная мощность с гарантией доступности 99% (SLA) и ценой за токен. Это устраняет необходимость ручного расчета GPU-часов.
- Dedicated Inference: выделенные ресурсы для максимального контроля и экономии на токенах при высоких нагрузках.
Post-training и кастомизация
Платформа позволяет проводить пост-обучение моделей непосредственно в экосистеме Together AI. Поддерживаются:
- Полное дообучение весов (full-weight).
- LoRA-усиленное обучение с подкреплением (RLHF).
- Продвинутое контролируемое дообучение (SFT).
Чекпоинты можно развертывать в инференс без переноса данных между системами. Также отмечается возможность использования моделей в качестве базы для fine-tuning с опцией снятия требований к атрибуции, предусмотренных лицензией MIT.
Сравнение возможностей развертывания
| Продукт | Целевая аудитория | Ключевые преимущества |
|---|---|---|
| Serverless | Разработчики на этапе прототипирования | Мгновенный запуск, отсутствие управления инфраструктурой |
| Provisioned Throughput | Коммерческие проекты с предсказуемой нагрузкой | SLA 99%, фиксированная цена за токен, гарантия пропускной способности |
| Dedicated Inference | Enterprise-решения с высокими требованиями к контролю | Выделенные ресурсы, оптимизация экономики токенов, непрерывные обновления |
Почему это важно
Партнерство закрывает критическую потребность разработчиков в «day-zero» доступе к передовым открытым моделям. Together AI гарантирует отсутствие хранения данных (zero data retention) и соответствие регуляторным требованиям. Инфраструктура уже оптимизирована для работы с крупными разреженными моделями, что подтверждается использованием платформы компаниями Cursor, Y Combinator и Decagon для агентных и кодинговых задач.
Источник: Together AI ↗
