Главная/Блог/Аналитика/Inkling от Thinking Machines: 1…
Аналитика8 мин чтения · 16 июля 2026 г.

Inkling от Thinking Machines: 1 триллион параметров и мультимодальность нового уровня

Разбираем архитектуру, возможности и способы запуска гигантской мультимодальной модели Inkling с 1T параметров, поддержкой аудио, изображений и контекстом в 1 млн токенов.

Inkling от Thinking Machines: 1 триллион параметров и мультимодальность нового уровня

В мире больших языковых моделей (LLM) мы привыкли к постепенному росту параметров, но выход модели Inkling от компании Thinking Machines — это не просто шаг, а качественный скачок. Это первая открытая модель такого масштаба, которая не просто «видит» картинки, но и понимает аудио, обладает агентными способностями и работает с контекстным окном в 1 миллион токенов. Для разработчиков и энтузиастов ИИ это открывает двери к созданию приложений, которые ранее были возможны только на закрытых коммерческих платформах.

Inkling — это не просто еще один чекпоинт в репозитории Hugging Face. Это фундаментально новая архитектура, сочетающая в себе эффективность Mixture-of-Experts (MoE), инновационные механизмы внимания и нативную поддержку нескольких модальностей. В этой статье мы подробно разберем, как устроен этот монстр, какие технические решения лежат в его основе, как его запустить локально или в облаке, и какие практические задачи он может решать уже сегодня.

01Архитектурные инновации: почему Inkling работает иначе

Чтобы понять мощь Inkling, нужно заглянуть под капот. Модель имеет 975 миллиардов параметров в общей сложности, но благодаря архитектуре Mixture-of-Experts (MoE) в каждый момент времени активны только 41 миллиард параметров. Это обеспечивает высокую скорость инференса при сохранении огромной емкости модели. Но самое интересное скрыто в деталях реализации слоев внимания и обработки данных.

Относительное внимание (Relative Attention)

Большинство современных трансформеров, таких как Llama или Mistral, используют позиционное кодирование RoPE (Rotary Position Embeddings) для передачи информации о положении токена в последовательности. Inkling идет другим путем. Вместо этого она использует Relative Attention. В каждом слое внимания модель учит позиционную информацию непосредственно в логитах внимания. Помимо стандартных проекций ключей, запросов и значений (Key, Query, Value), здесь вводится четвертая проекция, которая генерирует относительную характеристику R для каждого токена и головы внимания. Эта тензорная проекция корректируется с учетом расстояния между векторами ключа и запроса, что позволяет модели более гибко и точно обрабатывать длинные контексты.

💡
Почему это важно. Относительное внимание может лучше справляться с длинными последовательностями, так как оно не зависит от абсолютной позиции, а фокусируется на отношениях между токенами, что особенно полезно для задач, требующих анализа больших объемов текста или документов.

Гибридное внимание (Hybrid Attention)

Архитектура Inkling использует гибридный подход к механизму внимания. Слои декодера чередуются между глобальным вниманием (которое охватывает всю длину контекста) и вниманием скользящего окна (Sliding Window Attention), которое фокусируется на фиксированном окне токенов. Паттерн настроен как 5 слоев скользящего окна к 1 слою глобального внимания. Это обеспечивает вычислительную эффективность, так как большинство слоев работают с локальным контекстом, а финальный слой использует глобальное внимание для формирования богатых представлений. Такая структура позволяет модели эффективно обрабатывать контекст до 1 миллиона токенов без экспоненциального роста затрат памяти.

Inkling от Thinking Machines: 1 триллион параметров и мультимодальность нового уровня

Краткая 1D-свертка (Short Convolution, SConv)

Еще одной уникальной чертой Inkling является использование краткой 1D-свертки (SConv) над скрытыми состояниями. SConv считывает текущий токен и предыдущие W-1 скрытых состояний, где W — размер скользящего окна. Идея здесь заключается в том, что SConv берет на себя задачу локального внимания, освобождая модули внимания и MoE от необходимости кодировать локальные представления. Это улучшает общую эффективность модели и качество обработки локальных зависимостей в тексте.

Inkling от Thinking Machines: 1 триллион параметров и мультимодальность нового уровня

MoE с общими экспертами (Shared Experts Sink)

В стандартных моделях MoE маршрутизатор выбирает топ-k экспертов из общего пула. В Inkling маршрутизатор оценивает как маршрутизируемые эксперты, так и общие эксперты (shared experts). В модели используется 256 экспертов, из которых 6 выбираются алгоритмом Top-k, а 2 общих эксперта активны всегда. Это гарантирует, что некоторые базовые знания и навыки всегда доступны, независимо от входных данных, что повышает стабильность ответов модели.

02Мультимодальность: от пикселей к звуковым волнам

Inkling — это истинно мультимодальная модель. Она не просто «приклеивает» визуальный энкодер к текстовой модели, а интегрирует обработку изображений, аудио и текста на уровне архитектуры. Модули для каждой модальности относительно просты, что делает модель легкой для дообучения (fine-tuning) под специфические задачи.

Понимание изображений и видео

Для обработки изображений используется иерархический MLP-патчификатор. Линейные слои постепенно объединяют пиксели, пока на финальном слое не будет сформировано одно эмбеддинг-представление для каждого патча (куска изображения). Для видео добавляется дополнительная временная размерность, что позволяет модели анализировать изменения во времени. Хотя производительность для видео «из коробки» не оценивалась в деталях, архитектура явно рассчитана на эту возможность.

Понимание аудио

Обработка аудио в Inkling реализована через дискретизированную мел-спектрограмму. Аудио разбивается на чанки по 100 мс, каждый из которых преобразуется в мел-шкалу и классифицируется в конкретный бин спектрограммы. Эти значения затем встраиваются в башню эмбеддингов аудио, и итоговые представления суммируются. Такой подход позволяет модели эффективно «слышать» речь и звуковые паттерны, интегрируя их в общий контекст беседы.

03Инференс и развертывание: как запустить гиганта

Запуск модели с 975B параметров — это нетривиальная задача. Полная версия в формате BF16 требует 2 ТБ видеопамяти (VRAM), что доступно только на кластерах из множества GPU. Однако Thinking Machines и сообщество уже подготовили решения для разных сценариев использования, от облачных API до локального запуска на потребительском железе.

Поддержка в основных фреймворках

Inkling получил поддержку «день ноль» в основных библиотеках. Это означает, что вы можете использовать его сразу после установки, без необходимости писать кастомные адаптеры.

Transformers (Hugging Face)

Самый простой способ начать работу — использовать пайплайн any-to-any в библиотеке Transformers. Для этого требуется последняя версия библиотеки (5.14.0 и выше). Вы можете выбрать полную модель thinkingmachines/Inkling для GPU серии Hopper и новее, или квантованную версию thinkingmachines/Inkling-NVFP4 для GPU Blackwell.

terminalpython
from transformers import pipeline

model_id = "thinkingmachines/Inkling"
# model_id = "thinkingmachines/Inkling-NVFP4"

pipe = pipeline(
    "any-to-any", model=model_id
)

# Пример использования с изображением
image_url = "https://huggingface.co/datasets/merve/vl-test-suite/resolve/main/pills.jpg"
messages = [
    {
        "role": "user",
        "content": [
            {"type": "image", "image": image_url},
            {"type": "text", "text": "Do components in this supplement interact with each other?"},
        ],
    },
]

output = pipe(
    messages,
    max_new_tokens=2000,
    return_full_text=False,
    reasoning_effort="medium"
)
print(output[0]["generated_text"])

Для более тонкой настройки можно использовать классы AutoModelForMultimodalLM и AutoProcessor. Обратите внимание на параметр reasoning_effort, который позволяет контролировать глубину рассуждений модели: от "none" до "max". Это полезно для балансировки между скоростью и качеством ответа.

SGLang и vLLM

Для высокопроизводительного развертывания в продакшене推荐使用 SGLang и vLLM. SGLang предлагает кастомную реализацию модели, что делает его одним из самых быстрых вариантов на момент выхода. Команда запуска для SGLang с использованием 8 GPU выглядит так:

terminalbash
pip install sglang
python3 -m sglang.launch_server \
  --model-path thinkingmachines/Inkling \
  --tp-size 8 \
  --served-model-name inkling \
  --host 0.0.0.0 \
  --port 30000

vLLM также отлично подходит для продакшн-серверов. Он автоматически скачивает веса, распределяет модель по GPU с помощью тензорного параллелизма и запускает сервер, совместимый с API OpenAI. Не забудьте параметр --max-model-len, если вы упираетесь в ограничения кэша KV.

Inkling от Thinking Machines: 1 триллион параметров и мультимодальность нового уровня

Локальный запуск с llama.cpp и Unsloth

Для тех, у кого нет доступа к кластеру из 8+ GPU, есть отличная новость. Партнеры из Unsloth квантовали модель до 1-битной точности, сократив потребление VRAM на 95%. Это позволяет запускать Inkling на менее мощном оборудовании. С помощью llama.cpp можно запустить сервер, совместимый с OpenAI, следующей командой:

terminalbash
llama serve -hf unsloth/inkling-GGUF:UD-IQ1_S

Этот сервер запустится на http://localhost:8080/v1, и вы сможете взаимодействовать с ним через любые клиенты, поддерживающие OpenAI API. Также доступна встроенная UI в llama.cpp, которая поддерживает инструменты, MCP (Model Context Protocol) и агентные сценарии. Квантованные версии от Unsloth сохраняют около 74.2% точности top-1% при уменьшении размера модели на 86%.

04Агентные возможности и специфические задачи

Inkling не просто генерирует текст, он может действовать. Модель интегрируется с агентными фреймворками, такими как Pi. Pi — это минималистичный каркас для кодинга-агентов, который позволяет модели использовать внешние инструменты для решения сложных задач.

Для интеграции с Inkling через Pi нужно добавить конфигурацию в файл ~/.pi/agent/models.json, указав базовый URL роутера Hugging Face и API-ключ. После этого модель может использовать инструменты Pi для решения математических задач или написания кода, демонстрируя способность к планированию и выполнению действий.

Многотокенное предсказание (MTP)

Еще одна фишка Inkling — поддержка Multi-Token Prediction (MTP). В модель добавлены дополнительные слои, которые предсказывают несколько токенов одновременно. Во время инференса эти слои действуют как «черновики» (drafters) для спекулятивного декодирования. Это ускоряет генерацию без потери качества, так как финальная проверка происходит на основных весах модели. Использование MTP требует небольшого дополнительного объема VRAM, но дает заметный прирост скорости.

terminalpython
import torch
from transformers import AutoModelForMultimodalLM, AutoProcessor

processor = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
model = AutoModelForMultimodalLM.from_pretrained(
    "thinkingmachines/Inkling",
    dtype=torch.bfloat16,
    device_map="auto"
)

# ... preprocessing ...

generated = model.generate(
    **inputs,
    max_new_tokens=1000,
    do_sample=False,
    use_mtp=True  # Включаем MTP
)
print(processor.decode(generated[0], skip_special_tokens=True))

05Что это значит на практике

Появление Inkling меняет ландшафт открытых мультимодальных моделей. Вот ключевые выводы для разработчиков и исследователей:

  • Доступность мощи: Благодаря квантованию от Unsloth и поддержке llama.cpp, мощь модели в 1 триллион параметров становится доступной для локального запуска, albeit с некоторыми компромиссами в точности. Это democratizes доступ к SOTA-решениям.
  • Универсальность: Нативная поддержка аудио, изображений и текста в одной модели упрощает архитектуру приложений. Вам не нужно связывать разные модели для обработки разных типов данных, что снижает сложность развертывания и задержки.
  • Длинный контекст: Контекстное окно в 1 млн токенов открывает возможности для анализа огромных документов, кодовых баз или историй чатов, что критично для корпоративных задач и исследований.
  • Гибкость инференса: Поддержка SGLang, vLLM, Transformers и llama.cpp означает, что вы можете выбрать оптимальный стек для своих нужд: от быстрого прототипирования до высоконагруженного продакшена.

Inkling — это не просто еще одна модель, это инструмент нового поколения. Он требует ресурсов, но предлагает возможности, которые ранее были недоступны в открытом доступе. Если вы строите приложения, требующие глубокого понимания мультимодального контента и длинных контекстов, Inkling — это тот кандидат, на который стоит обратить внимание в первую очередь. Попробуйте запустить его, исследуйте его агентные возможности и посмотрите, как он справляется с вашими уникальными задачами.

Источник: Hugging Face ↗