Архитектура и масштаб: 975B параметров, 1M контекст
Inkling — это первая модель, обученная с нуля в Thinking Machines Lab. Это Mixture-of-Experts (MoE) трансформер с 66 слоями, где на каждый токен активируется 41B параметров из 975B общих. Архитектура базируется на 256 маршрутизируемых экспертах и 2 общих, используя сигмоидный роутер без вспомогательных потерь (auxiliary-loss-free).
Модель обучалась на 45 триллионах токенов текста, изображений, аудио и видео. Ключевая особенность — поддержка контекстного окна до 1 миллиона токенов. Ввод поддерживает текст, изображения (через 40x40 пиксельные патчи) и аудио (dMel спектрограммы), но вывод ограничен UTF-8 текстом.
Управляемое «усилие на размышление» (Controllable Thinking Effort)
Главное отличие Inkling — возможность динамически регулировать вычислительные ресурсы, затрачиваемые на ответ. Во время RL-обучения (более 30 млн рулонов) модель научилась адаптировать бюджет токенов под сложность задачи. Пользователь может задать уровень усилия через аргумент reasoning_effort (от minimal до max) или числовое значение от 0.2 до 0.99.
Это позволяет создавать гибридные пайплайны: дешевые запросы для маршрутизации и дорогие — для сложных задач. При этом Inkling тратит в три раза меньше токенов, чем Nemotron 3 Ultra, для достижения сопоставимого результата на Terminal Bench 2.1.
Производительность: сравнение с лидерами
Модель демонстрирует высокую устойчивость к адверсариальным атакам и конкурентоспособность в математике и коде. Ниже приведена сравнительная таблица ключевых бенчмарков (при effort=0.99, temp=1.0):
| Бенчмарк | Inkling | Nemotron 3 Ultra | Kimi K2.6 | GLM 5.2 | DeepSeek V4 Pro |
|---|---|---|---|---|---|
| HLE (text only) | 29.7% | 26.6% | 35.9% | 40.1% | 35.9% |
| AIME 2026 | 97.1% | 94.2% | 96.4% | 99.2% | 96.7% |
| GPQA Diamond | 87.2% | 86.7% | 91.1% | 89.5% | 88.8% |
| SWEBench Verified | 77.6% | 70.7% | 80.2% | 80.0% | 80.6% |
| Terminal Bench 2.1 | 63.8% | 56.4% | 71.3% | 82.7% | 64% |
| FORTRESS (Adversarial) | 78.0% | 77.6% | 65.6% | 71.3% | 36.0% |
Inkling лидирует среди открытых моделей по безопасности (FORTRESS: 78.0%), но уступает GLM 5.2 и Kimi K2.6 в сложных логических задачах (HLE) и техническом тестировании (Terminal Bench). Также отмечена слабая сторона: SimpleQA Verified (43.9%) значительно ниже, чем у DeepSeek V4 Pro (57.0%).
Деплой и стоимость
Веса доступны под лицензией Apache 2.0. Для запуска в BF16 требуется 2 ТБ VRAM (8x NVIDIA B300 или 16x H200). Квантованная версия NVFP4 снижает требования до 600 ГБ (4x B300 с W4A4 или 8x H200 с W4A16). Модель интегрирована в SGLang, vLLM, Unsloth и доступна через API у провайдеров TogetherAI, Fireworks, Modal, Databricks и Baseten.
Для чего подходит Inkling?
- Агенты с голосом и зрением: Идеально для поддержки клиентов, где нужно обработать аудио-звонок (16kHz WAV) и скриншот, чтобы сгенерировать структурированный тикет.
- Экономичные пайплайны: Использование низкого усилия для фильтрации запросов и высокого — для финальных вычислений.
- Доменная настройка: Лаборатория демонстрирует успешную тонкую настройку для финансовых задач и анализа графиков (CharXiv RQ: 82.0% с Python).
Также анонсирована легковесная версия Inkling-Small (276B параметров, 12B активных), веса которой станут доступны после завершения тестирования.
Бенчмарки
| Бенчмарк | Inkling | GLM 5.2 | Kimi K2.6 | Nemotron 3 Ultra |
|---|---|---|---|---|
| HLE (text only) | 29.7% | 40.1% | 35.9% | 26.6% |
| AIME 2026 | 97.1% | 99.2% | 96.4% | 94.2% |
| GPQA Diamond | 87.2% | 89.5% | 91.1% | 86.7% |
| SWEBench Verified | 77.6% | 80% | 80.2% | 70.7% |
| Terminal Bench 2.1 | 63.8% | 82.7% | 71.3% | 56.4% |
| SimpleQA Verified | 43.9% | 38.1% | 38.7% | 32.4% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
