Релиз модели16 июля 2026 г., 04:18 МСК🤖 Auto

Thinking Machines Lab выпустила Inkling: 975B параметров и управляемые вычисления

Лаборатория Thinking Machines Lab представила Inkling — мультимодальную MoE-модель с 975 млрд параметров, открытыми весами и уникальной возможностью контролировать «усилие на размышление» (thinking effort).

Баннер новости 3685

Архитектура и масштаб: 975B параметров, 1M контекст

Inkling — это первая модель, обученная с нуля в Thinking Machines Lab. Это Mixture-of-Experts (MoE) трансформер с 66 слоями, где на каждый токен активируется 41B параметров из 975B общих. Архитектура базируется на 256 маршрутизируемых экспертах и 2 общих, используя сигмоидный роутер без вспомогательных потерь (auxiliary-loss-free).

Модель обучалась на 45 триллионах токенов текста, изображений, аудио и видео. Ключевая особенность — поддержка контекстного окна до 1 миллиона токенов. Ввод поддерживает текст, изображения (через 40x40 пиксельные патчи) и аудио (dMel спектрограммы), но вывод ограничен UTF-8 текстом.

Управляемое «усилие на размышление» (Controllable Thinking Effort)

Главное отличие Inkling — возможность динамически регулировать вычислительные ресурсы, затрачиваемые на ответ. Во время RL-обучения (более 30 млн рулонов) модель научилась адаптировать бюджет токенов под сложность задачи. Пользователь может задать уровень усилия через аргумент reasoning_effort (от minimal до max) или числовое значение от 0.2 до 0.99.

Это позволяет создавать гибридные пайплайны: дешевые запросы для маршрутизации и дорогие — для сложных задач. При этом Inkling тратит в три раза меньше токенов, чем Nemotron 3 Ultra, для достижения сопоставимого результата на Terminal Bench 2.1.

Производительность: сравнение с лидерами

Модель демонстрирует высокую устойчивость к адверсариальным атакам и конкурентоспособность в математике и коде. Ниже приведена сравнительная таблица ключевых бенчмарков (при effort=0.99, temp=1.0):

Бенчмарк Inkling Nemotron 3 Ultra Kimi K2.6 GLM 5.2 DeepSeek V4 Pro
HLE (text only) 29.7% 26.6% 35.9% 40.1% 35.9%
AIME 2026 97.1% 94.2% 96.4% 99.2% 96.7%
GPQA Diamond 87.2% 86.7% 91.1% 89.5% 88.8%
SWEBench Verified 77.6% 70.7% 80.2% 80.0% 80.6%
Terminal Bench 2.1 63.8% 56.4% 71.3% 82.7% 64%
FORTRESS (Adversarial) 78.0% 77.6% 65.6% 71.3% 36.0%

Inkling лидирует среди открытых моделей по безопасности (FORTRESS: 78.0%), но уступает GLM 5.2 и Kimi K2.6 в сложных логических задачах (HLE) и техническом тестировании (Terminal Bench). Также отмечена слабая сторона: SimpleQA Verified (43.9%) значительно ниже, чем у DeepSeek V4 Pro (57.0%).

Деплой и стоимость

Веса доступны под лицензией Apache 2.0. Для запуска в BF16 требуется 2 ТБ VRAM (8x NVIDIA B300 или 16x H200). Квантованная версия NVFP4 снижает требования до 600 ГБ (4x B300 с W4A4 или 8x H200 с W4A16). Модель интегрирована в SGLang, vLLM, Unsloth и доступна через API у провайдеров TogetherAI, Fireworks, Modal, Databricks и Baseten.

Для чего подходит Inkling?

  • Агенты с голосом и зрением: Идеально для поддержки клиентов, где нужно обработать аудио-звонок (16kHz WAV) и скриншот, чтобы сгенерировать структурированный тикет.
  • Экономичные пайплайны: Использование низкого усилия для фильтрации запросов и высокого — для финальных вычислений.
  • Доменная настройка: Лаборатория демонстрирует успешную тонкую настройку для финансовых задач и анализа графиков (CharXiv RQ: 82.0% с Python).

Также анонсирована легковесная версия Inkling-Small (276B параметров, 12B активных), веса которой станут доступны после завершения тестирования.

Бенчмарки

БенчмаркInklingGLM 5.2Kimi K2.6Nemotron 3 Ultra
HLE (text only)29.7%40.1%35.9%26.6%
AIME 202697.1%99.2%96.4%94.2%
GPQA Diamond87.2%89.5%91.1%86.7%
SWEBench Verified77.6%80%80.2%70.7%
Terminal Bench 2.163.8%82.7%71.3%56.4%
SimpleQA Verified43.9%38.1%38.7%32.4%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗