Релиз модели16 июля 2026 г., 05:17 МСК🤖 Auto

Soofi S 30B-A3B: Немецкий MoE-модель бьет конкурентов в German и English

Консорциум Soofi представил гибридную Mamba-Transformer модель с 31.6B параметров. Она лидирует среди полностью открытых базовых моделей по немецкому и английскому языкам, обучена на 512 GPU NVIDIA B200.

Баннер новости 3686

Архитектура и эффективность

Soofi S 30B-A3B — это базовая модель (без инструктажа и safety-tuning) с архитектурой Mixture-of-Experts (MoE). Всего в модели ~31.6B параметров, но на один токен активируется лишь ~3.2B. Это достигается за счет стека из 52 слоев: 23 слоя Mamba-2, 23 слоя MoE (с 128 экспертами, из которых активируется 6) и 6 слоев GQA-attention, которые единственные хранят KV-cache. Модель использует архитектуру Nemotron 3 Nano, но с совершенно другим рецептом данных.

Обучение на суверенной инфраструктуре

Обучение прошло на промышленном облаке Deutsche Telekom в Мюнхене с 24 марта по 13 мая 2026 года. Использовалось до 512 GPU NVIDIA B200, что дало ~253,000 GPU-часов. Ключевая особенность — доля немецкого языка в данных: если в референсной модели Nemotron на все не-английские языки уходило ~5%, то в Soofi S доля немецкого во втором этапе обучения выросла до 15.32%. Источники данных включают HPLT v3/v4, German Commons, FineWiki и коммерчески лицензированные 193 млн статей из архивов Genios.

Результаты бенчмарков

Soofi S показала лучшие результаты среди полностью открытых базовых моделей (fully open base models). Ниже приведено сравнение с ключевыми конкурентами:

Бенчмарк Soofi S 30B-A3B Olmo 3 32B Apertus 70B EuroLLM 22B Alia 40B
English Aggregate 70.1 67.3 62.4 61.2 59.0
German Aggregate 79.1 69.2 72.8 70.6 68.4
Held-out (EN / DE) 41.4 / 41.8 33.1 / 36.2 27.6 / 33.5 30.8 / 33.9 28.0 / 29.4
HumanEval (pass@1) 73.8 63.0 30.2 39.3 23.8
MBPP-DE (pass@1) 84.2 70.8 50.9 59.4 45.6
GSM8K 86.1 80.7 65.4 25.1 65.4

По сравнению с архитектурно идентичным референсом Nemotron 3 Nano, Soofi S выигрывает 1.8 балла по английскому и 4.2 балла по немецкому языку, что доказывает эффективность нового датасета. Однако модель уступает Qwen3.5 35B-A3B в общих англоязычных метриках (70.3 против 70.1), хотя и лидирует по немецкому (79.1 против 70.3).

Практическое применение

Модель доступна в виде gated preview на Hugging Face. Благодаря поддержке контекстного окна до 1M токенов (на третьем этапе обучения) и высокой скорости декодирования (в 8-9 раз быстрее плотных моделей 14-24B), Soofi S подходит для:

  • Обработки немецких документов (страховые полисы, юридические тексты).
  • Билингвальной кодогенерации (немецкий промпт — Python код).
  • Высоконагруженных систем RAG с длинным контекстом (до 40K-256K токенов).

Весы можно запустить через vLLM или стандартный Hugging Face Transformers с флагом trust_remote_code=True.

Бенчмарки

БенчмаркSoofi S 30B-A3BApertus 70BEuroLLM 22BOlmo 3 32B
English aggregate70.1%62.4%61.2%67.3%
German aggregate79.1%72.8%70.6%69.2%
HumanEval (pass@1)73.8%30.2%39.3%63%
GPQA-Diamond43.4%27.3%30.3%33.3%
GSM8K86.1%65.4%25.1%80.7%
GLP-DE88.8%81.2%78.2%73%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗