Главная/Блог/Аналитика/LongCat-2.0: 1.6 трлн параметров и 1…
Аналитика9 мин чтения · 6 июля 2026 г.

LongCat-2.0: 1.6 трлн параметров и 1 млн контекста на отечественных ASIC

Meituan представила LongCat-2.0 — открытую MoE-модель с 1.6 трлн параметров, нативным контекстом в 1 млн токенов и обучением на российском/китайском железе. Разбираем архитектуру, бенчмарки и практическое применение.

LongCat-2.0: 1.6 трлн параметров и 1 млн контекста на отечественных ASIC

В мире искусственного интеллекта, где гонка за параметрами кажется бесконечной, компания Meituan совершила тихий, но мощный прорыв. Они выпустили LongCat-2.0 — крупную языковую модель (LLM) архитектуры Mixture-of-Experts (MoE) с колоссальным объемом в 1,6 триллиона параметров. Но цифры сами по себе не являются главной новостью. Настоящая революция кроется в деталях реализации: модель поддерживает нативное контекстное окно объемом в 1 миллион токенов и, что особенно важно для независимости от западных технологий, как обучение, так и инференс были выполнены полностью на отечественных (в данном случае китайских) суперкомпьютерных кластерах на базе ASIC-чипов, без использования оборудования NVIDIA.

LongCat-2.0 позиционируется не как универсальный чат-бот для повседневных разговоров, а как специализированный инструмент для agentic coding — агентского программирования. Это означает, что модель создана для понимания, генерации и выполнения кода в рамках сложных рабочих процессов автономных агентов. В условиях, когда разработчики все чаще полагаются на ИИ для написания сложных систем, способность модели удерживать в памяти целые репозитории кода и выполнять многошаговые задачи в терминале становится критически важной.

01Что такое LongCat-2.0 и почему это важно?

LongCat-2.0 является следующим поколением открытых моделей от Meituan, приходя на смену модели LongCat-Flash, выпущенной в 2025 году. Архитектура LongCat-2.0 была спроектирована с одной конкретной целью: обеспечить надежную и эффективную работу в задачах агентского программирования. Предварительное обучение (pretraining) заняло более 35 триллионов токенов, что потребовало миллионов часов работы ускорителей. Примечательно, что Meituan сообщает об отсутствии сбоев или необратимых скачков потерь (loss spikes) во время этого процесса. Эта стабильность особенно впечатляет при работе на аппаратном обеспечении, отличном от NVIDIA, где экосистема инструментов и отладки часто менее зрелая.

Важно отметить, что модель выпущена под лицензией MIT, что делает ее полностью открытой для коммерческого и исследовательского использования. Это открывает двери для интеграции LongCat-2.0 в корпоративные среды, где конфиденциальность данных и контроль над инфраструктурой являются приоритетами. Доступ к модели осуществляется через платформу LongCat API, которая поддерживает как OpenAI-совместимые, так и Anthropic-совместимые конечные точки, что упрощает миграцию существующих приложений.

LongCat-2.0: 1.6 трлн параметров и 1 млн контекста на отечественных ASIC

02Архитектура: Как модель с 1,6 трлн параметров остается экономичной

Одной из главных проблем масштабирования LLM является вычислительная стоимость. Модель с 1,6 триллионами параметров могла бы быть непомерно дорогой в использовании, если бы каждый токен требовал активации всех этих параметров. LongCat-2.0 решает эту проблему с помощью четырех ключевых архитектурных инноваций, которые снижают стоимость масштабирования.

Нулевые вычислительные эксперты (Zero-computation experts)

Не каждый токен требует тяжелых вычислений. В архитектуре LongCat-2.0 простые токены, такие как знаки препинания или пробелы, маршрутизируются к «экспертам с нулевыми вычислениями» и возвращаются без изменений. Сложные токены, напротив, задействуют большую часть экспертной емкости. Для управления этим процессом используется ПИД-регулятор (PID controller), который корректирует смещение экспертов, чтобы удерживать среднее количество активных параметров в диапазоне от 33 до 56 миллиардов. Это динамическое окно активации (вместо фиксированных затрат) позволяет модели эффективно использовать ресурсы. Основа MoE использует дизайн с короткими замыканиями (ScMoE) для повышения пропускной способности.

LongCat Sparse Attention (LSA)

Стандартный механизм внимания масштабируется квадратично с длиной контекста, что делает обработку 1 миллиона токенов практически невозможной на обычном оборудовании. LongCat Sparse Attention (LSA) выбирает только наиболее релевантные токены, снижая масштабирование до линейного. Meituan описывает LSA как эволюцию DeepSeek Sparse Attention (DSA). Она объединяет три ортогональных метода индексирования:

  • Streaming-aware Indexing: Превращает фрагментированные чтения памяти в непрерывные блоки, оптимизируя доступ к данным.
  • Cross-Layer Indexing: Повторно использует значимость внимания (attention saliency) между соседними слоями, избегая дублирования вычислений.
  • Hierarchical Indexing: Применяет двухэтапную фильтрацию от грубой к детальной, позволяя модели быстро отбрасывать нерелевантный контекст.

Вместе эти методы позволяют поддерживать контекстное окно в 1 миллион токенов без «стены памяти» (memory wall).

LongCat-2.0: 1.6 трлн параметров и 1 млн контекста на отечественных ASIC

N-gram Embedding

Архитектура также добавляет модуль встраивания N-грамм объемом 135 миллиардов параметров. Он расположен ортогонально экспертам MoE в разреженных измерениях. По словам Meituan, это позволяет захватывать плотные локальные отношения между токенами. Кроме того, это снижает нагрузку на ввод-вывод памяти (memory I/O) при декодировании больших батчей, что критично для скорости генерации.

Постобучение (MOPD)

Выделенный конвейер MOPD (Mixture of Policy Distillation) объединяет три группы экспертов-учителей, охватывающие способности к работе с агентами, рассуждению и взаимодействию, в единую унифицированную модель. Это обеспечивает сбалансированное поведение модели в сложных сценариях.

Для обслуживания (serving) Meituan использует схему параллелизма 6D и архитектуру с разделением этапов префилла и декодирования (prefill-decode disaggregated architecture). Также применяются «супер-ядра» (super kernels) и предварительная выборка весов из кэша L2 для скрытия задержек ввода-вывода.

💡
Ключевая особенность. Динамическая активация экспертов позволяет модели переключаться между режимом «экономии» для простых задач и режимом «максимальной мощности» для сложных кодовых задач, не требуя переплаты за простои.

03Бенчмарки: Как LongCat-2.0 справляется с задачами

Meituan позиционирует LongCat-2.0 как модель для агентского программирования, и результаты тестирования это подтверждают. Все приведенные ниже цифры основаны на собственных тестах Meituan. Важно отметить, что независимое подтверждение на публичных лидербордах пока отсутствует, поэтому данные следует воспринимать как заявленные производителем.

LongCat-2.0: 1.6 трлн параметров и 1 млн контекста на отечественных ASIC
Бенчмарк LongCat-2.0 Что измеряет
SWE-bench Pro 59.5 Реальные задачи инженерии программного обеспечения
Terminal-Bench 2.1 70.8 Выполнение команд и восстановление после ошибок в терминале
SWE-bench Multilingual 77.3 Задачи с репозиториями на нескольких языках

На SWE-bench Pro Meituan сообщает, что LongCat-2.0 немного опережает GPT-5.5 (58.6). Также заявляется, что общая производительность сопоставима с Google Gemini 3.1 Pro. Однако это преимущество сосредоточено именно в области инженерии программного обеспечения. На более общих бенчмарках для агентов, таких как FORTE и BrowseComp, модель, судя по всему, уступает ведущим системам уровня frontier. Это подчеркивает специализированный характер LongCat-2.0: она не пытается быть всем сразу, а бьет точно в цель — написание и отладку кода.

04Сравнение с LongCat-Flash

Переход от предыдущего поколения к новому впечатляет. Вот сравнение ключевых характеристик:

LongCat-2.0: 1.6 трлн параметров и 1 млн контекста на отечественных ASIC
d>Лицензия
Параметр LongCat-2.0 LongCat-Flash
Всего параметров 1.6T 560B
Активных на токен ~48B (33B–56B) ~27B (18.6B–31.3B)
Контекстное окно 1M токенов (нативное) 128K токенов
Внимание для длинного контекста LongCat Sparse Attention Multi-head Latent Attention
Отчетное оборудование Отечественные AI ASIC суперподы (обучение + инференс) GPU H800 (инференс)
Максимальный вывод 128K токенов Не указано
MIT MIT
Дата выпуска 30 июня 2026 Сентябрь 2025

Заметное увеличение контекстного окна с 128K до 1 миллиона токенов и переход на полностью отечественное оборудование (в контексте статьи — китайские ASIC, что актуально для обхода санкций против NVIDIA) делают LongCat-2.0 уникальным продуктом на рынке.

⚠️ Важно.
Доступность весов. На момент публикации веса модели еще не доступны для локального запуска. Пользователи могут взаимодействовать с моделью только через API. Это означает, что для работы с LongCat-2.0 требуется интернет-соединение и учетная запись на платформе LongCat.

05Практическое применение: Примеры использования

LongCat-2.0 настроена на агентскую работу с программным обеспечением, а не на обычные чаты. Вот несколько конкретных сценариев, где эта модель раскрывает свой потенциал:

Рассуждения над целым репозиторием

Благодаря контекстному окну в 1 миллион токенов, вы можете загрузить в модель целый средний по размеру кодовый репозиторий. Запросите модель отследить ошибку, которая распространяется через множество файлов одновременно. Это позволяет избежать «хаков» с суммаризацией, которые часто приводят к потере контекста в моделях с меньшим окном.

Многошаговые задачи в терминале

Запустите модель внутри агента с доступом к терминалу. Она может выполнять команды, читать ошибки и повторять попытки, пока задача не будет выполнена. Фокус на Terminal-Bench 2.1 нацелен именно на этот рабочий процесс. Это идеально для автоматизации развертывания, отладки серверов или настройки окружения.

Редактирование на уровне репозитория

Попросите модель провести рефакторинг, который охватывает несколько модулей и тестов. Модель рассуждает над полным контекстом, прежде чем предлагать скоординированные изменения. Это снижает риск появления багов при рефакторинге крупных систем.

Кросс-языковая миграция

Используйте силу SWE-bench Multilingual для полиглотных репозиториев. Модель может переносить логику между языками, сохраняя поведение. Например, миграция части бэкенда с Python на Go или Rust с сохранением всех тестовых кейсов.

LongCat-2.0: 1.6 трлн параметров и 1 млн контекста на отечественных ASIC

06Как получить доступ и стоимость

LongCat-2.0 доступна через платформу LongCat API. Она поддерживает как OpenAI-совместимые, так и Anthropic-совместимые конечные точки. Модель также доступна на OpenRouter и в таких инструментах, как Claude Code, OpenClaw, OpenCode и Codex. Локальный запуск пока невозможен, так как веса еще не опубликованы.

OpenAI-совместимая конечная точка использует идентификатор модели LongCat-2.0. Максимальная длина вывода составляет 131 072 токена (128K). Ниже приведен пример кода для вызова модели через библиотеку OpenAI для Python:

terminalpython
# pip install openai
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_LONGCAT_API_KEY",
    base_url="https://api.longcat.chat/openai/v1"
)

resp = client.chat.completions.create(
    model="LongCat-2.0",
    messages=[
        {"role": "system", "content": "You are a coding agent."},
        {"role": "user", "content": "Refactor utils.py to remove duplicate I/O logic."}
    ],
    max_tokens=4096  # LongCat-2.0 поддерживает до 131072 (128K)
)

print(resp.choices[0].message.content)

Стоимость использования составляет $0,75 за миллион входных токенов и $2,95 за миллион выходных токенов. Однако во время запуска действует акция: $0,30 за входные токены и $1,20 за выходные, при этом чтение кэшированного контекста бесплатно. Эти цифры основаны на информации из третьих источников и могут измениться.

07Что это значит на практике

Выход LongCat-2.0 знаменует собой сдвиг в парадигме разработки ИИ-моделей. Во-первых, это доказательство того, что можно обучать и запускать модели уровня frontier (передового уровня) без использования оборудования NVIDIA, полагаясь на отечественные ASIC-решения. Это критически важно для компаний и стран, стремящихся к технологическому суверенитету и независимости от западных санкций.

Во-вторых, специализация на агентском программировании с огромным контекстным окном открывает новые возможности для автоматизации сложных инженерных задач. Разработчики могут больше не беспокоиться о потере контекста при работе с большими кодовыми базами, а ИИ-агенты смогут выполнять более сложные многошаговые задачи с меньшим количеством ошибок.

В-третьих, открытая лицензия MIT и доступность через стандартные API (OpenAI/Anthropic) снижают порог входа для внедрения. Компании могут интегрировать LongCat-2.0 в свои рабочие процессы, используя знакомые инструменты, без необходимости переписывать весь стек.

Однако важно помнить, что модель все еще находится на стадии раннего доступа, и независимые тесты еще не подтвердили все заявленные результаты. Разработчикам стоит протестировать модель в своих конкретных сценариях, чтобы оценить ее реальную эффективность. Тем не менее, LongCat-2.0 представляет собой значительный шаг вперед в области открытых, эффективных и специализированных ИИ-моделей для программирования.

📌 Факт.
Объем обучения. Предварительное обучение LongCat-2.0 потребовало более 35 триллионов токенов. Для сравнения, это в десятки раз больше, чем объем данных, используемых для многих современных моделей, что говорит о глубокой проработке знаний модели.

Если вы работаете с большими кодовыми базами или автоматизируете процессы разработки, LongCat-2.0 определенно стоит того, чтобы обратить на нее внимание. Следите за обновлениями на официальном сайте longcat.ai и не забудьте проверить репозиторий GitHub для получения технических деталей, как только веса станут доступны.

Источник: MarkTechPost ↗