Главная/Блог/Аналитика/Inkling-Small: Открытый MoE-модель 276B…
Аналитика7 мин чтения · 3 августа 2026 г.

Inkling-Small: Открытый MoE-модель 276B с превосходным кодингом и аудио

Thinking Machines Lab выпустила Inkling-Small — компактную, но мощную мультимодальную модель с открытыми весами, которая превосходит своего старшего собрата в задачах программирования и рассуждений, оставаясь доступной для локального запуска.

Inkling-Small: Открытый MoE-модель 276B с превосходным кодингом и аудио

В мире искусственного интеллекта, где гонка за параметрами часто затмевает вопросы эффективности, выход модели Inkling-Small от компании Thinking Machines Lab становится знаковым событием. Это не просто еще одна версия большой языковой модели, а демонстрация того, как правильная архитектура и оптимизация обучения могут привести к тому, что «маленькая» модель превзойдет своего гигантского предшественника. Inkling-Small — это модель типа Mixture-of-Experts (MoE) с общим количеством параметров 276 миллиардов, из которых в процессе работы активны лишь 12 миллиардов. Для сравнения, ее старший брат, базовая модель Inkling, обладает внушительными 975 миллиардами параметров, но активными у нее 41 миллиард. Таким образом, Inkling-Small занимает примерно четверть от размера оригинала, но при этом демонстрирует выдающиеся результаты в сложных задачах.

Что делает эту модель по-настоящему революционной, так это ее мультимодальная природа и доступность. Модель обучена на мощных системах NVIDIA GB300 NVL72 и способна нативно работать с текстом, изображениями и аудио. Контекстное окно модели достигает колоссальных 1 миллиона токенов, что позволяет обрабатывать огромные объемы информации, а механизм «усилия мышления» (thinking effort) можно настраивать под конкретные задачи. Все веса модели распространяются под лицензией Apache 2.0 на платформе Hugging Face, что открывает двери для разработчиков, стартапов и корпораций по всему миру, включая Россию, где доступ к облачным ресурсам может быть ограничен, но локальный запуск на собственном оборудовании остается viable option.

01Доступность и развертывание: от облака к одному GPU

Одним из главных барьеров для внедрения передовых моделей ИИ в бизнес-процессы всегда была стоимость и сложность инфраструктуры. Inkling-Small ломает этот стереотип. Благодаря использованию квантованных чекпоинтов, модель становится значительно более доступной для развертывания. Оригинальный чекпоинт в формате BF16 требует агрегированной видеопамяти (VRAM) объемом не менее 600 ГБ. Это условие можно выполнить, используя, например, четыре видеокарты NVIDIA B300 или восемь NVIDIA H200. Однако истинная магия кроется в чекпоинте NVFP4.

Формат NVFP4 снижает порог входа до 180 ГБ VRAM. Это означает, что модель может работать на одной видеокарте NVIDIA B300 (при условии поддержки архитектуры SM100+) в конфигурации W4A4, или на двух видеокартах H200 в конфигурации W4A16. Такая возможность выводит модель из категории «фронтенд-лабораторий» в категорию практических инструментов для бизнеса. Стартапы теперь могут арендовать один экземпляр B300 и самостоятельно хостить модель, а средние предприятия с существующей инфраструктурой H200 могут обслуживать запросы без необходимости закупки нового оборудования.

Это открывает возможности для регулируемых секторов, таких как финансовые услуги, здравоохранение, страхование, телекоммуникации и государственный сектор, где конфиденциальность данных критически важна. Использование частных весов позволяет этим отраслям внедрять ИИ-решения, не отправляя чувствительные данные в сторонние облака. Поддерживаемые рантаймы включают SGLang, vLLM, TokenSpeed, Unsloth и Hugging Face, что обеспечивает гибкость в выборе стека технологий.

💡
Практический совет. Если у вас есть доступ к видеокартам NVIDIA H200, конфигурация W4A16 на двух устройствах является отличным компромиссом между скоростью инференса и простотой развертывания. Для максимального сжатия и работы на одном GPU выбирайте NVFP4 на B300.

02Архитектура: как работает мультимодальность

Inkling-Small построена на базе декодера-трансформера с 42 слоями и разреженной структурой Mixture-of-Experts (MoE) в качестве основы для прямого распространения. Архитектура спроектирована так, чтобы быть максимально эффективной. Каждый токен маршрутизируется к 6 из 256 экспертов, плюс 2 общих эксперта, которые активны для каждого токена. Это позволяет модели обрабатывать информацию параллельно, фокусируясь на специфических аспектах задачи, что значительно ускоряет вычисления по сравнению с плотными моделями.

Inkling-Small: Открытый MoE-модель 276B с превосходным кодингом и аудио

Механизм внимания (attention) является гибридным, сочетая локальные и глобальные слои, что помогает модели улавливать как локальные зависимости в тексте, так и глобальный контекст документа. Важно отметить, что модель не использует энкодер, что упрощает архитектуру и снижает вычислительные затраты. Нативная мультимодальность достигается за счет специальной обработки различных типов данных.

Изображения разбиваются на патчи размером 40x40 пикселей и преобразуются с помощью четырехслойного hMLP. Аудио представляется в виде спектрограмм dMel. Оба типа данных проходят через легкий слой эмбеддинга и обрабатываются совместно с текстовыми токенами. Это означает, что модель не просто «видит» картинку или «слышит» звук, а интегрирует их в единое семантическое пространство вместе с текстом. Числовые форматы поддержки включают BF16, MXFP8 и NVFP4. Для аудио входные данные должны быть в формате WAV с частотой дискретизации 16 кГц, и рекомендуется, чтобы длительность аудио не превышала двух минут. Выходные данные модели — исключительно текст, что делает ее идеальной для задач генерации ответов, кода или анализа.

03Обучение: от учителя к ученику

Интересный аспект Inkling-Small заключается в процессе ее обучения. В отличие от многих моделей, которые создаются параллельно, Inkling-Small начала обучение после своего старшего собрата. Это дало исследовательской команде возможность пересмотреть смесь данных для предварительного обучения и рецепт машинного обучения. Команда провела пост-обработку более раннего чекпоинта (Inkling-Small preview), используя дистилляцию on-policy с Inkling в качестве учителя. Это позволило перенести знания большой модели в меньшую.

Далее процесс пошел еще дальше: из этого чекпоинта команда продолжала масштабировать агентное обучение с подкреплением (RL) для программирования в течение двух недель. Этот этап был критически важен, так как именно он позволил модели развить навыки, необходимые для сложных задач кодинга и рассуждений, которые часто упускаются при простом масштабировании данных.

04Результаты бенчмарков: где Inkling-Small побеждает

Результаты тестирования Inkling-Small поражают, особенно если учитывать ее меньший размер. Модель превосходит своего учителя (Inkling) в ключевых задачах на рассуждение и агентное программирование. На тесте Humanity’s Last Exam (только текст) Inkling-Small набирает 31.6%, опережая Inkling с 29.7%. В задаче SWE-bench Verified (с использованием только bash) модель показывает результат 80.2% против 77.6% у Inkling. Terminal-Bench 2.1 достигает 64.7% в лучшем случае, а Toolathlon Verified — 54.4% против 45.5% у старшей модели.

Inkling-Small: Открытый MoE-модель 276B с превосходным кодингом и аудио

В области научных и математических рассуждений результаты также впечатляющие: GPQA Diamond — 89.5%, AIME 2026 — 95.5%, IFBench — 82.2%. ARC-AGI-2, тест на абстрактное рассуждение, поднимается до 40.1% с 36.5% у Inkling. Все оценки проводились при уровне «усилия мышления» 0.99 и температуре 1.0, с ограничением траектории в 256K токенов для задач программирования. Внешние оценки были получены из источников Artificial Analysis, Scale AI и ARC Prize.

⚠️ Важно.
Компромисс точности. Несмотря на превосходство в сложных задачах, Inkling-Small показывает регрессию в задачах на фактологическую точность. SimpleQA Verified упал до 20.6% с 43.9% у Inkling, а индекс AA Omniscience снизился до -9.0 с 2.1. Tau 3 Banking также показал худший результат: 15.5% против 23.7%. Это указывает на то, что модель лучше справляется с логикой и кодом, чем с простым запоминанием фактов.

05Мультимодальность, эпистемология и безопасность

Мультимодальные результаты остаются близкими к показателям Inkling, но при значительно меньших затратах. На тесте MMMU Pro модель набирает 74.0%. В задаче CharXiv RQ результат составляет 77.4%, который возрастает до 81.3%, когда модель использует Python для программной обрезки, масштабирования и проверки графиков. Аудио-модуль также работает отлично: Audio MC — 54.9%, MMAU — 77.0%, VoiceBench — 90.1%.

Особое внимание уделено эпистемологии, то есть способности модели оценивать свою уверенность в ответах. Калибровка была обучена с помощью RL против правил правильного скоринга на большом корпусе реальных вопросов прогнозирования. На тесте ForecastBench без поиска модель показала индекс Брайера 61.3 ± 0.46, что лучше, чем у Inkling (60.1 ± 0.54). Это означает, что Inkling-Small лучше понимает, когда она не уверена в ответе, что критически важно для принятия решений в бизнесе.

В плане безопасности модель демонстрирует высокие результаты: StrongREJECT — 98.4%, FORTRESS adversarial — 71.6%, FORTRESS benign — 96.9%. Thinking Machines Lab заключила, что модель не представляет существенного увеличения рисков по сравнению с существующей экосистемой с открытыми весами. Однако компания рекомендует использовать дополнительные уровни модерации, такие как Llama Guard, при развертывании моделей, ориентированных на конечных потребителей.

06Что это значит на практике

Выход Inkling-Small меняет ландшафт доступного ИИ. Для разработчиков это возможность создавать сложные агенты, которые могут читать документы, анализировать графики, слушать аудиозаписи и писать код, используя всего одну видеокарту среднего класса (или даже одну B300). Для бизнеса это шанс внедрить ИИ в регулируемые отрасли без риска утечки данных. Для исследователей это новый стандарт эффективности, показывающий, что качество не всегда требует количества параметров.

Модель доступна для тестирования на платформе Tinker с ограниченным по времени скидкой. Текстовый, образный и аудио-чат работают в Tinker Playground. Также доступен интерактивный эксплейнер, который разбивает релиз на четыре части: анимация маршрутизации экспертов, сравнение с другими моделями, визуализация слияния модальностей и расчет требований к оборудованию. Технические детали и веса модели можно найти на Hugging Face. Это отличный пример того, как открытое сообщество и коммерческие исследования могут работать вместе, создавая инструменты, которые делают передовой ИИ доступным для всех.

📌 Факт.
Лицензия Apache 2.0. Это одна из самых открытых лицензий, позволяющая использовать модель в коммерческих продуктах без необходимости открывать исходный код ваших собственных изменений. Это делает Inkling-Small идеальным выбором для коммерческих стартапов.

Источник: MarkTechPost ↗