Масштаб и архитектура: как удерживают стоимость
Meituan выпустила LongCat-2.0 — модель класса Trillion-Parameter с архитектурой Mixture-of-Experts (MoE). Общая численность параметров составляет 1.6 трлн, но за один токен активируется лишь ~48 млрд (в динамическом диапазоне 33–56 млрд). Это достигается за счет механизма «zero-computation experts»: простые токены (например, пунктуация) обрабатываются без вычислений, а сложные маршрутизируются к экспертам. Для оптимизации используется PID-контроллер, удерживающий нагрузку в заданных пределах.
Ключевое нововведение — LongCat Sparse Attention (LSA). В отличие от стандартного внимания с квадратичной сложностью, LSA выбирает только релевантные токены, снижая масштабирование до линейного. Технология объединяет три метода индексации:
- Streaming-aware Indexing: преобразует фрагментированные чтения памяти в непрерывные блоки.
- Cross-Layer Indexing: переиспользует салиентность внимания между соседними слоями.
- Hierarchical Indexing: двухэтапная фильтрация от грубой к детальной.
Также добавлен модуль N-gram Embedding (135 млрд параметров) для захвата локальных связей токенов и снижения I/O нагрузки при декодировании.
Результаты бенчмарков: лидерство в инженерии кода
Модель позиционируется как инструмент для Agentic Coding. По заявленным данным Meituan, LongCat-2.0 превосходит GPT-5.5 в задачах реальной инженерии ПО, хотя уступает лидерам в общих агентных бенчмарках (FORTE, BrowseComp).
| Бенчмарк | Результат LongCat-2.0 | Что измеряет |
|---|---|---|
| SWE-bench Pro | 59.5 | Реальные задачи инженерии ПО (превосходит GPT-5.5 с 58.6) |
| Terminal-Bench 2.1 | 70.8 | Выполнение команд и восстановление после ошибок в терминале |
| SWE-bench Multilingual | 77.3 | Задачи в мультиязычных репозиториях |
Железо: победа над эмбарго
Самый значимый аспект релиза — инфраструктура. Обучение на 35 триллионах токенов и инференс прошли на 50 000 чипов отечественных AI-ASIC (суперподы). Meituan утверждает, что не было сбоев или неконтролируемых скачков потерь, что критично для не-NVIDIA оборудования с менее зрелым софтом. Для обслуживания используется 6D-параллелизм, разделение prefill/decode и L2-cache prefetching.
Доступность и цены
Модель доступна через API (совместимо с OpenAI и Anthropic) на платформах LongCat, OpenRouter, а также в обертках Claude Code, OpenClaw и других. Веса пока не опубликованы, поэтому локальный запуск невозможен.
Тарификация: $0.75 за 1 млн входных токенов и $2.95 за 1 млн выходных. В рамках промо-акции цены снижены до $0.30 и $1.20 соответственно, при этом чтение кэшированного контекста бесплатно. Лицензия — MIT.
Бенчмарки
| Бенчмарк | LongCat-2.0 | GPT-5.5 |
|---|---|---|
| SWE-bench Pro | 59.5% | 58.6% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
