Масштаб и архитектура
Inkling — это модель с 975 миллиардами общих параметров, из которых в каждом шаге генерации активно используется только 41 миллиард благодаря механизму Mixture of Experts (MoE). Архитектура использует 256 экспертов, что обеспечивает высокую эффективность вычислений. Модель обучена на 45 триллионах токенов, включающих текст, изображения, аудио и видео, что позволяет ей нативно понимать и коррелировать данные разных модальностей.
Уникальные технические решения
В отличие от стандартных подходов, Inkling отказалась от RoPE в пользу relative attention для кодирования позиций, а также использует гибридную схему внимания: чередование глобального внимания и скользящего окна (соотношение 5:1). Для локального контекста применяется короткая 1D-свертка (SConv). Мультимодальные башни реализованы через простые иерархические MLP-патчификаторы для изображений и дискретизированные мел-спектрограммы для аудио, что упрощает интеграцию новых модальностей.
Характеристики и требования
Модель поддерживает контекстное окно в 1 миллион токенов и имеет агентные возможности. Доступны две версии чекпоинтов: полная BF16 и квантованная NVFP4. Ниже приведено сравнение требований к ресурсам:
| Характеристика | Inkling (BF16) | Inkling (NVFP4) |
|---|---|---|
| Активные параметры | 41B | 41B |
| 975B | 975B | |
| Требование VRAM | 2 TB | 600 GB |
| Рекомендуемое железо | Hopper и новее | Blackwell Nvidia |
| Контекстное окно | 1M токенов | 1M токенов |
Поддержка и интеграция
Thinking Machines обеспечила поддержку "day-0" для основных инструментов. Модель доступна в библиотеке transformers (версия 5.14.0+), а также в SGLang, vLLM и llama.cpp. Для управления глубиной рассуждений в API добавлен аргумент reasoning_effort с уровнями от "none" до "max". Развернуть модель можно как через серверные роутеры (Inference Providers), так и локально с использованием GGML-квантований.
Источник: Hugging Face blog ↗
