Релиз модели27 июля 2026 г., 13:45 МСК🤖 Auto

InclusionAI выпустила Ling-3.0-flash: 124B параметров, MoE и контекст до 1 млн токенов

InclusionAI представила агентную MoE-модель Ling-3.0-flash с 124 миллиардами параметров, способную обрабатывать до 1 миллиона токенов в контексте. Модель позиционируется как конкурент решений на 1 трлн параметров, но с экономией вычислений.

Баннер новости 4457

Архитектура и эффективность

InclusionAI выпустила новую модель Ling-3.0-flash, которая использует архитектуру Mixture of Experts (MoE). Ключевая особенность — разделение общего веса модели и активных параметров. При общем объеме в 124 миллиарда параметров, на каждый токен активируется лишь 5,1 миллиарда. Это обеспечивает высокую скорость инференса и снижает затраты на вычисления по сравнению с плотными моделями аналогичной мощности.

Контекстное окно и совместимость

Модель поддерживает стандартное контекстное окно до 256 тысяч токенов, с возможностью расширения до 1 миллиона токенов. Это делает её пригодной для задач, требующих анализа огромных объемов данных: длинных документов, логов, кодовых баз. API модели полностью совместим с интерфейсом OpenAI, что позволяет легко интегрировать её в существующие пайплайны без переписывания кода.

Производительность и бенчмарки

Согласно данным разработчиков и отзывам пользователей, Ling-3.0-flash демонстрирует результаты, сопоставимые с моделями класса «1 трлн параметров». Это указывает на высокую эффективность использования параметров в архитектуре MoE. Модель ориентирована на сложные задачи: программирование, поиск информации, исследования и работу с внешними инструментами (агентные сценарии).

Характеристика Значение
Общее количество параметров 124B
Активных параметров на токен 5.1B
Стандартный контекст 256K токенов
Максимальный контекст 1M токенов
Совместимость API OpenAI
Основное назначение Код, поиск, агенты, исследования

Доступность

Модель доступна через платформу OpenRouter. Разработчики предоставляют бесплатный доступ до 3 августа 2026 года. Также есть опция использования через сервис Kilo с ограниченным по времени доступом. Это позволяет широкому кругу разработчиков протестировать возможности модели в реальных задачах без финансовых барьеров.

Источник: Openrouter ↗