Релиз модели15 июля 2026 г., 21:31 МСК🤖 Auto

Inkling от Thinking Machines Lab: 975B параметров и Day-0 доступ на Together AI

Thinking Machines Lab выпустила мультимодальную MoE-модель Inkling с 40B активных параметров. Together AI предоставляет к ней доступ на Day-0 через серверless API с поддержкой 1M контекста.

Баннер новости 3656

Архитектурные инновации и спецификации

Inkling — это модель с архитектурой decoder-only Mixture-of-Experts (MoE), которая сочетает высокую вычислительную эффективность с продвинутыми мультимодальными способностями. В отличие от стандартных трансформеров, Inkling использует уникальные механизмы для оптимизации внимания и обработки контекста:

  • Query-Conditioned Relative Attention: Позиция токенов кодируется через обученный относительный bias, зависящий от запроса, что улучшает понимание порядка и локального контекста без использования RoPE.
  • Sconv (Short Causal Convolutions): Легкие канальные свертки с полем рецепции в 4 токена применяются к ключам, значениям и выходам слоев для эффективного объединения информации соседних токенов.
  • Shared Expert Sink MoE: Роутер выбирает узкий набор маршрутизируемых экспертов, но также назначает вес общим экспертам. В отличие от традиционных подходов, Inkling нормализует веса совместно, позволяя общему пути динамически конкурировать за вес на каждом токене.

Ключевые метрики и возможности

Модель поддерживает нативную обработку текста, изображений и аудио через единый стек декодера. Визуальные патчи и квантованные аудиофункции преобразуются в эмбеддинги той же ширины, что и текстовые токены, и вставляются непосредственно в входную последовательность. Разработчики могут регулировать глубину рассуждений через параметр reasoning_effort, балансируя между скоростью, использованием токенов и качеством ответа.

Параметр Значение / Характеристика
Общее число параметров 975B
Активные параметры на токен 40B
Контекстное окно 1,000,000 токенов (1M)
Входные модальности Текст, Изображения, Аудио
Выходная модальность Текст
Оптимизация внимания FlashAttention-4 (кастомное ядро)

Производительность и задачи

Предварительные оценки показывают сильные результаты в задачах, требующих глубокого логического анализа. Inkling демонстрирует высокую точность в научном рассуждении на уровне выпускных программ, соревновательной математике, программировании и агентных рабочих процессах. Особое внимание уделено калиброванным прогнозам (forecasting) и оценке неопределенности, что расширяет применение модели за рамки простого QA в финансовые и аналитические системы.

Доступность на Together AI

Together AI предоставляет доступ к Inkling на Day-0 через свой серверless API. Это позволяет разработчикам запускать модель без управления инфраструктурой или ожидания выделения GPU. API совместим с OpenAI, что упрощает интеграцию. Для работы используется оптимизированное ядро FlashAttention-4, специально разработанное для поддержки механизма query-conditioned relative attention в продакшен-среде.

Пример интеграции

Разработчики могут начать работу с модели, используя стандартный Python-клиент Together AI. Ниже приведен базовый пример запроса с указанием усилия рассуждений:

from together import Together
client = Together()
response = client.chat.completions.create(
    model="[INKLING_MODEL_ID]",
    messages=[{"role": "user", "content": "Analyze this problem carefully."}],
    reasoning_effort="[SUPPORTED_VALUE]"
)
print(response.choices[0].message.content)

Источник: Together AI ↗