Главная/Блог/Гайд/Cohere North Small Translate: 218B MoE…
Гайд4 мин чтения · 11 сентября 2026 г.

Cohere North Small Translate: 218B MoE для перевода на 50 языков

Cohere представила модель North Small Translate (218B MoE, 25B активных параметров), которая демонстрирует рекордные результаты на WMT26, превосходя DeepL и Google Translate, и доступна для локального запуска на одном GPU.

Cohere North Small Translate: 218B MoE для перевода на 50 языков

В мире искусственного интеллекта, где гонка за параметрами часто затмевает практическую пользу, компания Cohere совершает шаг, который может изменить правила игры в области машинного перевода. Недавно они выпустили North Small Translate — модель с открытыми весами, которая сочетает в себе мощь архитектуры Mixture-of-Experts (MoE) с удивительной эффективностью. Это не просто еще одна языковая модель; это специализированный инструмент, созданный для решения одной из самых сложных задач в NLP — точного перевода между 50 языками, от албанского до вьетнамского.

Что делает эту модель особенной? Во-первых, ее архитектура. North Small Translate имеет 218 миллиардов параметров в общей сложности, но благодаря механизму MoE, в обработке каждого токена участвует только 25 миллиардов. Это обеспечивает высокую скорость и снижает затраты на вычисления. Во-вторых, результаты. На внутреннем тестировании Cohere модель показала заметное превосходство над такими гигантами, как DeepL, Google Translate, а также открытыми моделями GLM 5.2 и Mistral Large 3. Но самое главное — эта модель доступна для коммерческого использования, бесплатного использования через API (до определенных лимитов) и, что особенно важно для российских пользователей, для локального развертывания.

В этой статье мы подробно разберем архитектуру модели, ее производительность, сравнение с конкурентами, а также практические аспекты запуска, включая требования к оборудованию и примеры кода. Мы также обсудим, почему перевод становится вопросом технологического суверенитета и как North Small Translate вписывается в эту картину.

01Контекст: Возвращение к истокам Transformer

Чтобы понять значимость выпуска North Small Translate, нужно вернуться к истокам. В 2017 году исследователи из Google представили архитектуру Transformer в статье "Attention Is All You Need". Именно эта архитектура стала фундаментом для современных больших языковых моделей. Первые значимые результаты Transformer были достигнуты именно на задачах машинного перевода, в частности, на переводах с английского на немецкий и французский языки в рамках конкурса WMT 2014.

Cohere North Small Translate: 218B MoE для перевода на 50 языков

Спустя 9 лет Cohere возвращается к этой первоначальной проблеме, но с новыми технологиями и масштабом. В своем посте в X (бывший Twitter) Cohere формулирует перевод не просто как техническую задачу, а как вопрос суверенитета. Организациям, которые не могут эффективно общаться на глобальном уровне, трудно сохранять свой суверенитет. В эпоху геополитической напряженности и ограничений на доступ к некоторым западным сервисам, наличие надежных, локально развертываемых моделей перевода становится критически важным.

North Small Translate является первой моделью в семействе "North" от Cohere. Она следует за предыдущими моделями, такими как Tiny Aya и Command A Translate, формируя четкую линейку многоязычных решений. Важно отметить, что модель была разработана в сотрудничестве с RWS (RWS Group), одной из ведущих мировых компаний в области управления языковыми данными. Ученые и эксперты RWS по языку Language Weaver внесли значительный вклад в обеспечение высокого качества перевода в реальных сценариях использования.

02Архитектура: Как работает 218B MoE

Архитектура North Small Translate — это decoder-only sparse MoE Transformer. Давайте разберем ключевые компоненты этой структуры, чтобы понять, как достигается баланс между мощностью и эффективностью.

Cohere North Small Translate: 218B MoE для перевода на 50 языков

Эксперты и маршрутизация

Модель использует 128 "экспертов" (нейронных сетей внутри модели). Однако, для каждого входного токена активируется только 8 из них. Это и есть суть Sparse Mixture-of-Experts. Кроме того, есть "общие эксперты", которые применяются к каждому токену. Маршрутизация (router) работает на основе сигмоиды над логитами экспертов, нормализованной по выбранным top-k. Это позволяет модели динамически выбирать наиболее подходящие "специализированные" части для каждого конкретного фрагмента текста.

Механизм внимания (Attention)

Одной из ключевых особенностей является структура внимания. Модель использует чередующиеся слои: слои с скользящим окном (sliding-window, окно 4096, с позиционным кодированием RoPE) и глобальные слои без позиционных вложений. Соотношение слоев 3:1. Такая архитектура была впервые представлена в модели Command A. Скользящее окно позволяет эффективно обрабатывать длинные контексты, фокусируясь на локальных зависимостях, в то время как глобальные слои захватывают более широкий контекст.

Контекст и обучение

Модель поддерживает контекстное окно до 16 000 входных и 16 000 выходных токенов. Важно отметить, что на данный момент модель работает только с текстом. Обучение модели было специализированным: она была дообучена (post-trained) специально для улучшения качества перевода. Примерно 11.5% весов активны для каждого токена, что соответствует 25 миллиардам активных параметров. Однако, для работы модели в памяти все равно необходимо удерживать все 218 миллиардов параметров, что накладывает определенные требования к видеопамяти GPU.

💡
Технический нюанс. Несмотря на то, что активно используется только 25B параметров, полная модель весит около 218B. Это означает, что для локального запуска вам потребуется GPU с большим объемом VRAM, даже если вы используете квантованные версии модели. Например, для BF16 версии потребуется 4x B200 или 8x H100, но есть и более легкие варианты.

03Производительность и бенчмарки WMT26

Результаты тестирования North Small Translate впечатляют. Cohere представила оценки на WMT26, которые показывают средние баллы по всем 50 языкам. Давайте посмотрим на сравнительную таблицу, которую предоставила компания:

Источник: MarkTechPost ↗

Модель Оценка WMT26
North Small Translate (Agentic) 84.36