Архитектурные инновации и спецификации
Inkling — это модель с архитектурой decoder-only Mixture-of-Experts (MoE), которая сочетает высокую вычислительную эффективность с продвинутыми мультимодальными способностями. В отличие от стандартных трансформеров, Inkling использует уникальные механизмы для оптимизации внимания и обработки контекста:
- Query-Conditioned Relative Attention: Позиция токенов кодируется через обученный относительный bias, зависящий от запроса, что улучшает понимание порядка и локального контекста без использования RoPE.
- Sconv (Short Causal Convolutions): Легкие канальные свертки с полем рецепции в 4 токена применяются к ключам, значениям и выходам слоев для эффективного объединения информации соседних токенов.
- Shared Expert Sink MoE: Роутер выбирает узкий набор маршрутизируемых экспертов, но также назначает вес общим экспертам. В отличие от традиционных подходов, Inkling нормализует веса совместно, позволяя общему пути динамически конкурировать за вес на каждом токене.
Ключевые метрики и возможности
Модель поддерживает нативную обработку текста, изображений и аудио через единый стек декодера. Визуальные патчи и квантованные аудиофункции преобразуются в эмбеддинги той же ширины, что и текстовые токены, и вставляются непосредственно в входную последовательность. Разработчики могут регулировать глубину рассуждений через параметр reasoning_effort, балансируя между скоростью, использованием токенов и качеством ответа.
| Параметр | Значение / Характеристика |
|---|---|
| Общее число параметров | 975B |
| Активные параметры на токен | 40B |
| Контекстное окно | 1,000,000 токенов (1M) |
| Входные модальности | Текст, Изображения, Аудио |
| Выходная модальность | Текст |
| Оптимизация внимания | FlashAttention-4 (кастомное ядро) |
Производительность и задачи
Предварительные оценки показывают сильные результаты в задачах, требующих глубокого логического анализа. Inkling демонстрирует высокую точность в научном рассуждении на уровне выпускных программ, соревновательной математике, программировании и агентных рабочих процессах. Особое внимание уделено калиброванным прогнозам (forecasting) и оценке неопределенности, что расширяет применение модели за рамки простого QA в финансовые и аналитические системы.
Доступность на Together AI
Together AI предоставляет доступ к Inkling на Day-0 через свой серверless API. Это позволяет разработчикам запускать модель без управления инфраструктурой или ожидания выделения GPU. API совместим с OpenAI, что упрощает интеграцию. Для работы используется оптимизированное ядро FlashAttention-4, специально разработанное для поддержки механизма query-conditioned relative attention в продакшен-среде.
Пример интеграции
Разработчики могут начать работу с модели, используя стандартный Python-клиент Together AI. Ниже приведен базовый пример запроса с указанием усилия рассуждений:
from together import Together
client = Together()
response = client.chat.completions.create(
model="[INKLING_MODEL_ID]",
messages=[{"role": "user", "content": "Analyze this problem carefully."}],
reasoning_effort="[SUPPORTED_VALUE]"
)
print(response.choices[0].message.content)
Источник: Together AI ↗
