Масштаб и архитектура: выход на уровень Frontier
Компания Meituan представила LongCat-2.0 — крупную языковую модель (LLM) с архитектурой Mixture-of-Experts (MoE). Модель обладает 1,6 триллионами параметров в общей сложности, но при каждом токене активируется лишь около 48 миллиардов. Это позволяет достичь производительности уровня передовых проприетарных моделей (GPT-4.5, Claude Opus) при значительно меньших вычислительных затратах на инференс.
Ключевое отличие LongCat-2.0 от предыдущих версий — полный отказ от закрытых чипов NVIDIA в пользу собственных AI ASIC суперподов. Обучение прошло на более чем 35 триллионах токенов без сбоев, что доказывает жизнеспособность альтернативных аппаратных платформ для обучения моделей масштаба Frontier.
Инновации: Sparse Attention и N-gram Embedding
Для работы с контекстом до 1 миллиона токенов (1M-context) разработчики внедрили LongCat Sparse Attention (LSA). Эта технология решает проблему квадратичной сложности внимания через три механизма:
- Streaming-aware Indexing (SI): преобразует фрагментированный доступ к памяти в последовательные чтения, повышая эффективность использования HBM.
- Cross-Layer Indexing (CLI): использует стабильность внимания между слоями, позволяя одному проиндексированному слою обслуживать несколько последующих.
- Hierarchical Indexing (HI): двухэтапный отбор токенов (грубый поиск, затем точная выборка), сокращающий объем вычислений.
Также в модель интегрированы N-gram Embedding (135 млрд параметров), что улучшает использование параметров в разреженных измерениях, дополняя архитектуру MoE.
Бенчмарки: где LongCat-2.0 побеждает гигантов
Модель показала выдающиеся результаты в задачах агентного программирования (Agentic Coding), обогнав Gemini 3.1 Pro и GPT-5.5 в ряде метрик. Ниже приведено сравнение ключевых показателей:
| Бенчмарк | LongCat-2.0 | Gemini 3.1 Pro | GPT-5.5 | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Pro (Решение сложных багов) | 59.5 | 54.2 | 58.6 | 69.2 |
| Terminal-Bench 2.1 (Code Agent) | 70.8 | 70.7 | 73.8 | 78.9 |
| FORTE (General Agent) | 73.2 | 70.3 | 77.8 | 77.2 |
| GPQA-diamond (Наука/Логика) | 88.9 | 94.3 | 93.6 | 92.4 |
| IFEval (Следование инструкциям) | 90.0 | 96.1 | 95.0 | 86.0 |
Обратите внимание: в SWE-bench Pro LongCat-2.0 превосходит Gemini 3.1 Pro и GPT-5.5, уступая только самым свежим версиям Claude. В задаче Terminal-Bench модель демонстрирует паритет с Gemini.
Открытость и развертывание
Важнейшая новость для разработчиков: веса модели выпущены под лицензией MIT, что разрешает коммерческое использование без ограничений. LongCat-2.0 интегрируется с популярными фреймворками, такими как Claude Code, OpenClaw и Hermes.
Развертывание поддерживается как на GPU (рекомендуется 16x H20 с использованием SGLang), так и на NPU. Для GPU-деплоя уже доступна адаптация в SGLang с поддержкой Tensor Parallelism и Expert Parallelism.
Бенчмарки
| Бенчмарк | LongCat-2.0 | Claude Opus 4.6 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 70.8% | 71.7% | 73.8% | 70.7% |
| SWE-bench Pro | 59.5% | 57.3% | 58.6% | 54.2% |
| SWE-bench Multilingual | 77.3% | 80.5% | 77.8% | 76.9% |
| FORTE | 73.2% | 73.2% | 77.8% | 70.3% |
| BrowseComp | 79.9% | 84% | 84.4% | 85.9% |
| RWSearch | 78.8% | 81.3% | 85.3% | 76.3% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Huggingface ↗
