Релиз модели6 июля 2026 г., 13:46 МСК🤖 Auto

LongCat-2.0: 1.6 трлн параметров, MIT-лицензия и победа над Gemini 3.1 Pro

Meituan выпустила первую полностью открытую LLM с архитектурой MoE на 1.6 трлн параметров. Модель демонстрирует лидерство в задачах программирования и обходит проприетарные аналоги, используя собственные AI-ASIC.

Баннер новости 2950

Масштаб и архитектура: выход на уровень Frontier

Компания Meituan представила LongCat-2.0 — крупную языковую модель (LLM) с архитектурой Mixture-of-Experts (MoE). Модель обладает 1,6 триллионами параметров в общей сложности, но при каждом токене активируется лишь около 48 миллиардов. Это позволяет достичь производительности уровня передовых проприетарных моделей (GPT-4.5, Claude Opus) при значительно меньших вычислительных затратах на инференс.

Ключевое отличие LongCat-2.0 от предыдущих версий — полный отказ от закрытых чипов NVIDIA в пользу собственных AI ASIC суперподов. Обучение прошло на более чем 35 триллионах токенов без сбоев, что доказывает жизнеспособность альтернативных аппаратных платформ для обучения моделей масштаба Frontier.

Инновации: Sparse Attention и N-gram Embedding

Для работы с контекстом до 1 миллиона токенов (1M-context) разработчики внедрили LongCat Sparse Attention (LSA). Эта технология решает проблему квадратичной сложности внимания через три механизма:

  • Streaming-aware Indexing (SI): преобразует фрагментированный доступ к памяти в последовательные чтения, повышая эффективность использования HBM.
  • Cross-Layer Indexing (CLI): использует стабильность внимания между слоями, позволяя одному проиндексированному слою обслуживать несколько последующих.
  • Hierarchical Indexing (HI): двухэтапный отбор токенов (грубый поиск, затем точная выборка), сокращающий объем вычислений.

Также в модель интегрированы N-gram Embedding (135 млрд параметров), что улучшает использование параметров в разреженных измерениях, дополняя архитектуру MoE.

Бенчмарки: где LongCat-2.0 побеждает гигантов

Модель показала выдающиеся результаты в задачах агентного программирования (Agentic Coding), обогнав Gemini 3.1 Pro и GPT-5.5 в ряде метрик. Ниже приведено сравнение ключевых показателей:

Бенчмарк LongCat-2.0 Gemini 3.1 Pro GPT-5.5 Claude Opus 4.8
SWE-bench Pro (Решение сложных багов) 59.5 54.2 58.6 69.2
Terminal-Bench 2.1 (Code Agent) 70.8 70.7 73.8 78.9
FORTE (General Agent) 73.2 70.3 77.8 77.2
GPQA-diamond (Наука/Логика) 88.9 94.3 93.6 92.4
IFEval (Следование инструкциям) 90.0 96.1 95.0 86.0

Обратите внимание: в SWE-bench Pro LongCat-2.0 превосходит Gemini 3.1 Pro и GPT-5.5, уступая только самым свежим версиям Claude. В задаче Terminal-Bench модель демонстрирует паритет с Gemini.

Открытость и развертывание

Важнейшая новость для разработчиков: веса модели выпущены под лицензией MIT, что разрешает коммерческое использование без ограничений. LongCat-2.0 интегрируется с популярными фреймворками, такими как Claude Code, OpenClaw и Hermes.

Развертывание поддерживается как на GPU (рекомендуется 16x H20 с использованием SGLang), так и на NPU. Для GPU-деплоя уже доступна адаптация в SGLang с поддержкой Tensor Parallelism и Expert Parallelism.

Бенчмарки

БенчмаркLongCat-2.0Claude Opus 4.6GPT-5.5Gemini 3.1 Pro
Terminal-Bench 2.170.8%71.7%73.8%70.7%
SWE-bench Pro59.5%57.3%58.6%54.2%
SWE-bench Multilingual77.3%80.5%77.8%76.9%
FORTE73.2%73.2%77.8%70.3%
BrowseComp79.9%84%84.4%85.9%
RWSearch78.8%81.3%85.3%76.3%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Huggingface ↗