Релиз модели18 июля 2026 г., 07:20 МСК🤖 Auto

Inkling от Thinking Machines: 1 трлн параметров и 1M контекста

Thinking Machines представила Inkling — первую открытую мультимодальную LLM с архитектурой MoE, способную обрабатывать текст, изображения и аудио в контексте до 1 миллиона токенов.

Баннер новости 3872

Масштаб и архитектура

Inkling — это модель с 975 миллиардами общих параметров, из которых в каждом шаге генерации активно используется только 41 миллиард благодаря механизму Mixture of Experts (MoE). Архитектура использует 256 экспертов, что обеспечивает высокую эффективность вычислений. Модель обучена на 45 триллионах токенов, включающих текст, изображения, аудио и видео, что позволяет ей нативно понимать и коррелировать данные разных модальностей.

Уникальные технические решения

В отличие от стандартных подходов, Inkling отказалась от RoPE в пользу relative attention для кодирования позиций, а также использует гибридную схему внимания: чередование глобального внимания и скользящего окна (соотношение 5:1). Для локального контекста применяется короткая 1D-свертка (SConv). Мультимодальные башни реализованы через простые иерархические MLP-патчификаторы для изображений и дискретизированные мел-спектрограммы для аудио, что упрощает интеграцию новых модальностей.

Характеристики и требования

Модель поддерживает контекстное окно в 1 миллион токенов и имеет агентные возможности. Доступны две версии чекпоинтов: полная BF16 и квантованная NVFP4. Ниже приведено сравнение требований к ресурсам:

d>Общие параметры
Характеристика Inkling (BF16) Inkling (NVFP4)
Активные параметры 41B 41B
975B 975B
Требование VRAM 2 TB 600 GB
Рекомендуемое железо Hopper и новее Blackwell Nvidia
Контекстное окно 1M токенов 1M токенов

Поддержка и интеграция

Thinking Machines обеспечила поддержку "day-0" для основных инструментов. Модель доступна в библиотеке transformers (версия 5.14.0+), а также в SGLang, vLLM и llama.cpp. Для управления глубиной рассуждений в API добавлен аргумент reasoning_effort с уровнями от "none" до "max". Развернуть модель можно как через серверные роутеры (Inference Providers), так и локально с использованием GGML-квантований.

Источник: Hugging Face blog ↗