Релиз модели3 августа 2026 г., 02:18 МСК🤖 Auto

Inkling-Small: 276B MoE-модель, бьющая Inkling в коде и работающая на одной GPU

Thinking Machines Lab выпустила Inkling-Small — 276B параметров (12B активных), которая превосходит 975B-версию в агентном коде и запускается на одной NVIDIA B300.

Баннер новости 4920

Архитектура и доступность

Thinking Machines Lab представила Inkling-Small, модель с открытыми весами (лицензия Apache 2.0) на базе Hugging Face. Это Mixture-of-Experts (MoE) архитектура с 42 слоями, где на каждый токен маршрутизируется 6 из 256 экспертов плюс 2 общих. Модель обучена на системах NVIDIA GB300 NVL72 и поддерживает контекстное окно до 1 млн токенов. Ключевое отличие от старшей версии (Inkling, 975B параметров) — возможность работы на ограниченном оборудовании благодаря квантованию.

Железо и развертывание

Модель стала первой в своем классе, способной работать на одной GPU для коммерческого использования. BF16-версия требует 600 ГБ VRAM (4x B300 или 8x H200), но NVFP4-чекпоинт снижает порог до 180 ГБ, позволяя запустить модель на одной NVIDIA B300 (W4A4) или двух H200 (W4A16). Поддерживаются SGLang, vLLM, Unsloth и другие рантаймы.

Результаты бенчмарков

Inkling-Small демонстрирует парадоксальное поведение: она превосходит своего «учителя» (Inkling) в задачах на рассуждение и программирование, но уступает в фактологической точности. Ниже приведено сравнение ключевых метрик:

Бенчмарк Inkling-Small (276B) Inkling (975B) Примечание
HLE (Humanity's Last Exam) 31.6% 29.7% Текст, рассуждение
SWE-bench Verified 80.2% 77.6% Agentic coding
Terminal-Bench 2.1 64.7% Автоматизация терминала
Toolathlon Verified 54.4% 45.5% Использование инструментов
SimpleQA Verified 20.6% 43.9% Фактологическая память (регрессия)
GPQA Diamond 89.5% Научные вопросы
CharXiv RQ 77.4% Анализ графиков

Мультимодальность и безопасность

Модель нативно обрабатывает текст, изображения (патчи 40x40) и аудио (dMel спектрограммы WAV 16kHz). В задачах мультимодального понимания результаты близки к старшей версии: MMMU Pro — 74.0%, VoiceBench — 90.1%. В области эпистемической калибровки (ForecastBench) Inkling-Small показала индекс Брайера 61.3, что лучше, чем у Inkling (60.1). Безопасность оценивается в 98.4% по StrongREJECT, однако разработчики рекомендуют использовать дополнительные фильтры (например, Llama Guard) для публичных деплойментов.

Почему это важно

Выход Inkling-Small меняет экономику развертывания frontier-моделей. Стартапы и предприятия среднего бизнеса теперь могут хостить 276B-параметровую модель с сильными агентными способностями на одной арендованной GPU B300, избегая затрат на кластеры из десятков карт. Это открывает путь к приватным решениям для финтеха, здравоохранения и телекома, где важны как безопасность данных, так и стоимость владения.

Бенчмарки

БенчмаркInklingInkling-Small
Humanity's Last Exam29.7%31.6%
SWE-bench Verified77.6%80.2%
Toolathlon Verified45.5%54.4%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗