В мире искусственного интеллекта, где гонка за параметрами часто затмевает практическую пользу, компания Cohere совершает шаг, который может изменить правила игры в области машинного перевода. Недавно они выпустили North Small Translate — модель с открытыми весами, которая сочетает в себе мощь архитектуры Mixture-of-Experts (MoE) с удивительной эффективностью. Это не просто еще одна языковая модель; это специализированный инструмент, созданный для решения одной из самых сложных задач в NLP — точного перевода между 50 языками, от албанского до вьетнамского.
Что делает эту модель особенной? Во-первых, ее архитектура. North Small Translate имеет 218 миллиардов параметров в общей сложности, но благодаря механизму MoE, в обработке каждого токена участвует только 25 миллиардов. Это обеспечивает высокую скорость и снижает затраты на вычисления. Во-вторых, результаты. На внутреннем тестировании Cohere модель показала заметное превосходство над такими гигантами, как DeepL, Google Translate, а также открытыми моделями GLM 5.2 и Mistral Large 3. Но самое главное — эта модель доступна для коммерческого использования, бесплатного использования через API (до определенных лимитов) и, что особенно важно для российских пользователей, для локального развертывания.
В этой статье мы подробно разберем архитектуру модели, ее производительность, сравнение с конкурентами, а также практические аспекты запуска, включая требования к оборудованию и примеры кода. Мы также обсудим, почему перевод становится вопросом технологического суверенитета и как North Small Translate вписывается в эту картину.
01Контекст: Возвращение к истокам Transformer
Чтобы понять значимость выпуска North Small Translate, нужно вернуться к истокам. В 2017 году исследователи из Google представили архитектуру Transformer в статье "Attention Is All You Need". Именно эта архитектура стала фундаментом для современных больших языковых моделей. Первые значимые результаты Transformer были достигнуты именно на задачах машинного перевода, в частности, на переводах с английского на немецкий и французский языки в рамках конкурса WMT 2014.

Спустя 9 лет Cohere возвращается к этой первоначальной проблеме, но с новыми технологиями и масштабом. В своем посте в X (бывший Twitter) Cohere формулирует перевод не просто как техническую задачу, а как вопрос суверенитета. Организациям, которые не могут эффективно общаться на глобальном уровне, трудно сохранять свой суверенитет. В эпоху геополитической напряженности и ограничений на доступ к некоторым западным сервисам, наличие надежных, локально развертываемых моделей перевода становится критически важным.
North Small Translate является первой моделью в семействе "North" от Cohere. Она следует за предыдущими моделями, такими как Tiny Aya и Command A Translate, формируя четкую линейку многоязычных решений. Важно отметить, что модель была разработана в сотрудничестве с RWS (RWS Group), одной из ведущих мировых компаний в области управления языковыми данными. Ученые и эксперты RWS по языку Language Weaver внесли значительный вклад в обеспечение высокого качества перевода в реальных сценариях использования.
02Архитектура: Как работает 218B MoE
Архитектура North Small Translate — это decoder-only sparse MoE Transformer. Давайте разберем ключевые компоненты этой структуры, чтобы понять, как достигается баланс между мощностью и эффективностью.

Эксперты и маршрутизация
Модель использует 128 "экспертов" (нейронных сетей внутри модели). Однако, для каждого входного токена активируется только 8 из них. Это и есть суть Sparse Mixture-of-Experts. Кроме того, есть "общие эксперты", которые применяются к каждому токену. Маршрутизация (router) работает на основе сигмоиды над логитами экспертов, нормализованной по выбранным top-k. Это позволяет модели динамически выбирать наиболее подходящие "специализированные" части для каждого конкретного фрагмента текста.
Механизм внимания (Attention)
Одной из ключевых особенностей является структура внимания. Модель использует чередующиеся слои: слои с скользящим окном (sliding-window, окно 4096, с позиционным кодированием RoPE) и глобальные слои без позиционных вложений. Соотношение слоев 3:1. Такая архитектура была впервые представлена в модели Command A. Скользящее окно позволяет эффективно обрабатывать длинные контексты, фокусируясь на локальных зависимостях, в то время как глобальные слои захватывают более широкий контекст.
Контекст и обучение
Модель поддерживает контекстное окно до 16 000 входных и 16 000 выходных токенов. Важно отметить, что на данный момент модель работает только с текстом. Обучение модели было специализированным: она была дообучена (post-trained) специально для улучшения качества перевода. Примерно 11.5% весов активны для каждого токена, что соответствует 25 миллиардам активных параметров. Однако, для работы модели в памяти все равно необходимо удерживать все 218 миллиардов параметров, что накладывает определенные требования к видеопамяти GPU.
03Производительность и бенчмарки WMT26
Результаты тестирования North Small Translate впечатляют. Cohere представила оценки на WMT26, которые показывают средние баллы по всем 50 языкам. Давайте посмотрим на сравнительную таблицу, которую предоставила компания:
| Модель | Оценка WMT26 |
|---|---|
| North Small Translate (Agentic) | 84.36 | Источник: MarkTechPost ↗
