Архитектура и эффективность
InclusionAI выпустила новую модель Ling-3.0-flash, которая использует архитектуру Mixture of Experts (MoE). Ключевая особенность — разделение общего веса модели и активных параметров. При общем объеме в 124 миллиарда параметров, на каждый токен активируется лишь 5,1 миллиарда. Это обеспечивает высокую скорость инференса и снижает затраты на вычисления по сравнению с плотными моделями аналогичной мощности.
Контекстное окно и совместимость
Модель поддерживает стандартное контекстное окно до 256 тысяч токенов, с возможностью расширения до 1 миллиона токенов. Это делает её пригодной для задач, требующих анализа огромных объемов данных: длинных документов, логов, кодовых баз. API модели полностью совместим с интерфейсом OpenAI, что позволяет легко интегрировать её в существующие пайплайны без переписывания кода.
Производительность и бенчмарки
Согласно данным разработчиков и отзывам пользователей, Ling-3.0-flash демонстрирует результаты, сопоставимые с моделями класса «1 трлн параметров». Это указывает на высокую эффективность использования параметров в архитектуре MoE. Модель ориентирована на сложные задачи: программирование, поиск информации, исследования и работу с внешними инструментами (агентные сценарии).
| Характеристика | Значение |
|---|---|
| Общее количество параметров | 124B |
| Активных параметров на токен | 5.1B |
| Стандартный контекст | 256K токенов |
| Максимальный контекст | 1M токенов |
| Совместимость API | OpenAI |
| Основное назначение | Код, поиск, агенты, исследования |
Доступность
Модель доступна через платформу OpenRouter. Разработчики предоставляют бесплатный доступ до 3 августа 2026 года. Также есть опция использования через сервис Kilo с ограниченным по времени доступом. Это позволяет широкому кругу разработчиков протестировать возможности модели в реальных задачах без финансовых барьеров.
Источник: Openrouter ↗
