Прорыв в точности и масштабе
Cohere и Cohere Labs выпустили North Small Translate — первую модель семейства North, специализированную для перевода. Это разреженная архитектура Mixture-of-Experts (MoE) с общим объемом 218 миллиардов параметров, из которых в каждом токене активно только 25 миллиардов (11.5%). Модель поддерживает 50 языков, от албанского до вьетнамского, и демонстрирует выдающиеся результаты на внутреннем бенчмарке WMT26.
Сравнение с лидерами рынка
По заявленным данным Cohere, модель превосходит как коммерческие гиганты (DeepL, Google Translate), так и открытые аналоги (GLM 5.2, Mistral Large 3). Важно отметить, что оценки основаны на прогоне через судью GPT-5.6-Sol, поэтому результаты следует считать заявленными производителем до независимой верификации.
| Модель | Средний балл WMT26 | Примечание |
|---|---|---|
| North Small Translate (Agentic) | 84.36 | Многоэтапный поиск и исправление ошибок |
| North Small Translate | 83.60 | Стандартный режим |
| Qwen 3.5 397B A17B | 81.56 | Открытый аналог |
| DeepL NextGen | 81.37 | Лидер коммерческого сегмента |
| Gemma 4 31B (on) | 79.46 | Открытый аналог |
| GLM 5.2 FP8 | 76.50 | Открытый аналог |
| Google Translate | 68.20 | Индустріальный стандарт |
Производительность и работа с длинными контекстами
Модель демонстрирует высокую скорость генерации: 112 токенов в секунду при низкой конкуренции (против 81 у Gemma 4 31B на том же оборудовании). Ключевое преимущество — работа с длинными документами. При переводе двух глав книги за один вызов North Small Translate набирает 48.9 баллов по метрике xCOMET-XL, тогда как Google Translate получает лишь 21.3, а Gemma 4 — 19.4.
Экономика и развертывание
Стоимость задачи (в среднем 661 токен) составляет $0.000676, что примерно в 58 раз дешевле, чем использование Gemini 3.1 Pro Preview. Модель доступна через API Cohere (бесплатно до лимитов), а также для самостоятельного хостинга. Оптимизированные чекпоинты позволяют запускать модель на относительно скромном железе: например, версия NVFP4 W4A16 работает на 1 GPU NVIDIA B200 или 2x H100.
Архитектурные особенности
Модель использует декодер-только структуру Transformer с 128 экспертами, из которых активируется 8 на токен. Архитектура внимания сочетает слои скользящего окна (окно 4096, RoPE) и глобальные слои без позиционных вложений в соотношении 3:1. Контекстное окно составляет 16K входных и 16K выходных токенов. Разработка велась совместно с RWS, чьи эксперты Language Weaver обеспечили качество, близкое к профессиональному.
Бенчмарки
| Бенчмарк | North Small Translate | North Small Translate (Agentic) | DeepL NextGen | Gemma 4 31B | Gemma 4 31B (on) | Google Translate | Qwen 3.5 397B A17B |
|---|---|---|---|---|---|---|---|
| WMT26 | 83.6% | 84.36% | 81.37% | — | — | — | 81.56% |
| WMT26 (EU languages) | 82.17% | — | — | — | 72.73% | — | — |
| WMT26 (South Asia) | 86.16% | — | — | — | 88.04% | — | — |
| Long Documents (xCOMET-XL) | 48.9score | — | — | 19.4score | — | 21.3score | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
