В мире искусственного интеллекта, где гонка за параметрами кажется бесконечной, компания Meituan совершила тихий, но мощный прорыв. Они выпустили LongCat-2.0 — крупную языковую модель (LLM) архитектуры Mixture-of-Experts (MoE) с колоссальным объемом в 1,6 триллиона параметров. Но цифры сами по себе не являются главной новостью. Настоящая революция кроется в деталях реализации: модель поддерживает нативное контекстное окно объемом в 1 миллион токенов и, что особенно важно для независимости от западных технологий, как обучение, так и инференс были выполнены полностью на отечественных (в данном случае китайских) суперкомпьютерных кластерах на базе ASIC-чипов, без использования оборудования NVIDIA.
LongCat-2.0 позиционируется не как универсальный чат-бот для повседневных разговоров, а как специализированный инструмент для agentic coding — агентского программирования. Это означает, что модель создана для понимания, генерации и выполнения кода в рамках сложных рабочих процессов автономных агентов. В условиях, когда разработчики все чаще полагаются на ИИ для написания сложных систем, способность модели удерживать в памяти целые репозитории кода и выполнять многошаговые задачи в терминале становится критически важной.
01Что такое LongCat-2.0 и почему это важно?
LongCat-2.0 является следующим поколением открытых моделей от Meituan, приходя на смену модели LongCat-Flash, выпущенной в 2025 году. Архитектура LongCat-2.0 была спроектирована с одной конкретной целью: обеспечить надежную и эффективную работу в задачах агентского программирования. Предварительное обучение (pretraining) заняло более 35 триллионов токенов, что потребовало миллионов часов работы ускорителей. Примечательно, что Meituan сообщает об отсутствии сбоев или необратимых скачков потерь (loss spikes) во время этого процесса. Эта стабильность особенно впечатляет при работе на аппаратном обеспечении, отличном от NVIDIA, где экосистема инструментов и отладки часто менее зрелая.
Важно отметить, что модель выпущена под лицензией MIT, что делает ее полностью открытой для коммерческого и исследовательского использования. Это открывает двери для интеграции LongCat-2.0 в корпоративные среды, где конфиденциальность данных и контроль над инфраструктурой являются приоритетами. Доступ к модели осуществляется через платформу LongCat API, которая поддерживает как OpenAI-совместимые, так и Anthropic-совместимые конечные точки, что упрощает миграцию существующих приложений.

02Архитектура: Как модель с 1,6 трлн параметров остается экономичной
Одной из главных проблем масштабирования LLM является вычислительная стоимость. Модель с 1,6 триллионами параметров могла бы быть непомерно дорогой в использовании, если бы каждый токен требовал активации всех этих параметров. LongCat-2.0 решает эту проблему с помощью четырех ключевых архитектурных инноваций, которые снижают стоимость масштабирования.
Нулевые вычислительные эксперты (Zero-computation experts)
Не каждый токен требует тяжелых вычислений. В архитектуре LongCat-2.0 простые токены, такие как знаки препинания или пробелы, маршрутизируются к «экспертам с нулевыми вычислениями» и возвращаются без изменений. Сложные токены, напротив, задействуют большую часть экспертной емкости. Для управления этим процессом используется ПИД-регулятор (PID controller), который корректирует смещение экспертов, чтобы удерживать среднее количество активных параметров в диапазоне от 33 до 56 миллиардов. Это динамическое окно активации (вместо фиксированных затрат) позволяет модели эффективно использовать ресурсы. Основа MoE использует дизайн с короткими замыканиями (ScMoE) для повышения пропускной способности.
LongCat Sparse Attention (LSA)
Стандартный механизм внимания масштабируется квадратично с длиной контекста, что делает обработку 1 миллиона токенов практически невозможной на обычном оборудовании. LongCat Sparse Attention (LSA) выбирает только наиболее релевантные токены, снижая масштабирование до линейного. Meituan описывает LSA как эволюцию DeepSeek Sparse Attention (DSA). Она объединяет три ортогональных метода индексирования:
- Streaming-aware Indexing: Превращает фрагментированные чтения памяти в непрерывные блоки, оптимизируя доступ к данным.
- Cross-Layer Indexing: Повторно использует значимость внимания (attention saliency) между соседними слоями, избегая дублирования вычислений.
- Hierarchical Indexing: Применяет двухэтапную фильтрацию от грубой к детальной, позволяя модели быстро отбрасывать нерелевантный контекст.
Вместе эти методы позволяют поддерживать контекстное окно в 1 миллион токенов без «стены памяти» (memory wall).

N-gram Embedding
Архитектура также добавляет модуль встраивания N-грамм объемом 135 миллиардов параметров. Он расположен ортогонально экспертам MoE в разреженных измерениях. По словам Meituan, это позволяет захватывать плотные локальные отношения между токенами. Кроме того, это снижает нагрузку на ввод-вывод памяти (memory I/O) при декодировании больших батчей, что критично для скорости генерации.
Постобучение (MOPD)
Выделенный конвейер MOPD (Mixture of Policy Distillation) объединяет три группы экспертов-учителей, охватывающие способности к работе с агентами, рассуждению и взаимодействию, в единую унифицированную модель. Это обеспечивает сбалансированное поведение модели в сложных сценариях.
Для обслуживания (serving) Meituan использует схему параллелизма 6D и архитектуру с разделением этапов префилла и декодирования (prefill-decode disaggregated architecture). Также применяются «супер-ядра» (super kernels) и предварительная выборка весов из кэша L2 для скрытия задержек ввода-вывода.
03Бенчмарки: Как LongCat-2.0 справляется с задачами
Meituan позиционирует LongCat-2.0 как модель для агентского программирования, и результаты тестирования это подтверждают. Все приведенные ниже цифры основаны на собственных тестах Meituan. Важно отметить, что независимое подтверждение на публичных лидербордах пока отсутствует, поэтому данные следует воспринимать как заявленные производителем.

| Бенчмарк | LongCat-2.0 | Что измеряет |
|---|---|---|
| SWE-bench Pro | 59.5 | Реальные задачи инженерии программного обеспечения |
| Terminal-Bench 2.1 | 70.8 | Выполнение команд и восстановление после ошибок в терминале |
| SWE-bench Multilingual | 77.3 | Задачи с репозиториями на нескольких языках |
На SWE-bench Pro Meituan сообщает, что LongCat-2.0 немного опережает GPT-5.5 (58.6). Также заявляется, что общая производительность сопоставима с Google Gemini 3.1 Pro. Однако это преимущество сосредоточено именно в области инженерии программного обеспечения. На более общих бенчмарках для агентов, таких как FORTE и BrowseComp, модель, судя по всему, уступает ведущим системам уровня frontier. Это подчеркивает специализированный характер LongCat-2.0: она не пытается быть всем сразу, а бьет точно в цель — написание и отладку кода.
04Сравнение с LongCat-Flash
Переход от предыдущего поколения к новому впечатляет. Вот сравнение ключевых характеристик:

| Параметр | LongCat-2.0 | LongCat-Flash |
|---|---|---|
| Всего параметров | 1.6T | 560B |
| Активных на токен | ~48B (33B–56B) | ~27B (18.6B–31.3B) |
| Контекстное окно | 1M токенов (нативное) | 128K токенов |
| Внимание для длинного контекста | LongCat Sparse Attention | Multi-head Latent Attention |
| Отчетное оборудование | Отечественные AI ASIC суперподы (обучение + инференс) | GPU H800 (инференс) |
| Максимальный вывод | 128K токенов | Не указано |
| MIT | MIT | |
| Дата выпуска | 30 июня 2026 | Сентябрь 2025 |
Заметное увеличение контекстного окна с 128K до 1 миллиона токенов и переход на полностью отечественное оборудование (в контексте статьи — китайские ASIC, что актуально для обхода санкций против NVIDIA) делают LongCat-2.0 уникальным продуктом на рынке.
05Практическое применение: Примеры использования
LongCat-2.0 настроена на агентскую работу с программным обеспечением, а не на обычные чаты. Вот несколько конкретных сценариев, где эта модель раскрывает свой потенциал:
Рассуждения над целым репозиторием
Благодаря контекстному окну в 1 миллион токенов, вы можете загрузить в модель целый средний по размеру кодовый репозиторий. Запросите модель отследить ошибку, которая распространяется через множество файлов одновременно. Это позволяет избежать «хаков» с суммаризацией, которые часто приводят к потере контекста в моделях с меньшим окном.
Многошаговые задачи в терминале
Запустите модель внутри агента с доступом к терминалу. Она может выполнять команды, читать ошибки и повторять попытки, пока задача не будет выполнена. Фокус на Terminal-Bench 2.1 нацелен именно на этот рабочий процесс. Это идеально для автоматизации развертывания, отладки серверов или настройки окружения.
Редактирование на уровне репозитория
Попросите модель провести рефакторинг, который охватывает несколько модулей и тестов. Модель рассуждает над полным контекстом, прежде чем предлагать скоординированные изменения. Это снижает риск появления багов при рефакторинге крупных систем.
Кросс-языковая миграция
Используйте силу SWE-bench Multilingual для полиглотных репозиториев. Модель может переносить логику между языками, сохраняя поведение. Например, миграция части бэкенда с Python на Go или Rust с сохранением всех тестовых кейсов.

06Как получить доступ и стоимость
LongCat-2.0 доступна через платформу LongCat API. Она поддерживает как OpenAI-совместимые, так и Anthropic-совместимые конечные точки. Модель также доступна на OpenRouter и в таких инструментах, как Claude Code, OpenClaw, OpenCode и Codex. Локальный запуск пока невозможен, так как веса еще не опубликованы.
OpenAI-совместимая конечная точка использует идентификатор модели LongCat-2.0. Максимальная длина вывода составляет 131 072 токена (128K). Ниже приведен пример кода для вызова модели через библиотеку OpenAI для Python:
# pip install openai
from openai import OpenAI
client = OpenAI(
api_key="YOUR_LONGCAT_API_KEY",
base_url="https://api.longcat.chat/openai/v1"
)
resp = client.chat.completions.create(
model="LongCat-2.0",
messages=[
{"role": "system", "content": "You are a coding agent."},
{"role": "user", "content": "Refactor utils.py to remove duplicate I/O logic."}
],
max_tokens=4096 # LongCat-2.0 поддерживает до 131072 (128K)
)
print(resp.choices[0].message.content)Стоимость использования составляет $0,75 за миллион входных токенов и $2,95 за миллион выходных токенов. Однако во время запуска действует акция: $0,30 за входные токены и $1,20 за выходные, при этом чтение кэшированного контекста бесплатно. Эти цифры основаны на информации из третьих источников и могут измениться.
07Что это значит на практике
Выход LongCat-2.0 знаменует собой сдвиг в парадигме разработки ИИ-моделей. Во-первых, это доказательство того, что можно обучать и запускать модели уровня frontier (передового уровня) без использования оборудования NVIDIA, полагаясь на отечественные ASIC-решения. Это критически важно для компаний и стран, стремящихся к технологическому суверенитету и независимости от западных санкций.
Во-вторых, специализация на агентском программировании с огромным контекстным окном открывает новые возможности для автоматизации сложных инженерных задач. Разработчики могут больше не беспокоиться о потере контекста при работе с большими кодовыми базами, а ИИ-агенты смогут выполнять более сложные многошаговые задачи с меньшим количеством ошибок.
В-третьих, открытая лицензия MIT и доступность через стандартные API (OpenAI/Anthropic) снижают порог входа для внедрения. Компании могут интегрировать LongCat-2.0 в свои рабочие процессы, используя знакомые инструменты, без необходимости переписывать весь стек.
Однако важно помнить, что модель все еще находится на стадии раннего доступа, и независимые тесты еще не подтвердили все заявленные результаты. Разработчикам стоит протестировать модель в своих конкретных сценариях, чтобы оценить ее реальную эффективность. Тем не менее, LongCat-2.0 представляет собой значительный шаг вперед в области открытых, эффективных и специализированных ИИ-моделей для программирования.
Если вы работаете с большими кодовыми базами или автоматизируете процессы разработки, LongCat-2.0 определенно стоит того, чтобы обратить на нее внимание. Следите за обновлениями на официальном сайте longcat.ai и не забудьте проверить репозиторий GitHub для получения технических деталей, как только веса станут доступны.
Источник: MarkTechPost ↗
