Архитектура и доступность
Thinking Machines Lab представила Inkling-Small, модель с открытыми весами (лицензия Apache 2.0) на базе Hugging Face. Это Mixture-of-Experts (MoE) архитектура с 42 слоями, где на каждый токен маршрутизируется 6 из 256 экспертов плюс 2 общих. Модель обучена на системах NVIDIA GB300 NVL72 и поддерживает контекстное окно до 1 млн токенов. Ключевое отличие от старшей версии (Inkling, 975B параметров) — возможность работы на ограниченном оборудовании благодаря квантованию.
Железо и развертывание
Модель стала первой в своем классе, способной работать на одной GPU для коммерческого использования. BF16-версия требует 600 ГБ VRAM (4x B300 или 8x H200), но NVFP4-чекпоинт снижает порог до 180 ГБ, позволяя запустить модель на одной NVIDIA B300 (W4A4) или двух H200 (W4A16). Поддерживаются SGLang, vLLM, Unsloth и другие рантаймы.
Результаты бенчмарков
Inkling-Small демонстрирует парадоксальное поведение: она превосходит своего «учителя» (Inkling) в задачах на рассуждение и программирование, но уступает в фактологической точности. Ниже приведено сравнение ключевых метрик:
| Бенчмарк | Inkling-Small (276B) | Inkling (975B) | Примечание |
|---|---|---|---|
| HLE (Humanity's Last Exam) | 31.6% | 29.7% | Текст, рассуждение |
| SWE-bench Verified | 80.2% | 77.6% | Agentic coding |
| Terminal-Bench 2.1 | 64.7% | — | Автоматизация терминала |
| Toolathlon Verified | 54.4% | 45.5% | Использование инструментов |
| SimpleQA Verified | 20.6% | 43.9% | Фактологическая память (регрессия) |
| GPQA Diamond | 89.5% | — | Научные вопросы |
| CharXiv RQ | 77.4% | — | Анализ графиков |
Мультимодальность и безопасность
Модель нативно обрабатывает текст, изображения (патчи 40x40) и аудио (dMel спектрограммы WAV 16kHz). В задачах мультимодального понимания результаты близки к старшей версии: MMMU Pro — 74.0%, VoiceBench — 90.1%. В области эпистемической калибровки (ForecastBench) Inkling-Small показала индекс Брайера 61.3, что лучше, чем у Inkling (60.1). Безопасность оценивается в 98.4% по StrongREJECT, однако разработчики рекомендуют использовать дополнительные фильтры (например, Llama Guard) для публичных деплойментов.
Почему это важно
Выход Inkling-Small меняет экономику развертывания frontier-моделей. Стартапы и предприятия среднего бизнеса теперь могут хостить 276B-параметровую модель с сильными агентными способностями на одной арендованной GPU B300, избегая затрат на кластеры из десятков карт. Это открывает путь к приватным решениям для финтеха, здравоохранения и телекома, где важны как безопасность данных, так и стоимость владения.
Бенчмарки
| Бенчмарк | Inkling | Inkling-Small |
|---|---|---|
| Humanity's Last Exam | 29.7% | 31.6% |
| SWE-bench Verified | 77.6% | 80.2% |
| Toolathlon Verified | 45.5% | 54.4% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
