Архитектура и эффективность
Soofi S 30B-A3B — это базовая модель (без инструктажа и safety-tuning) с архитектурой Mixture-of-Experts (MoE). Всего в модели ~31.6B параметров, но на один токен активируется лишь ~3.2B. Это достигается за счет стека из 52 слоев: 23 слоя Mamba-2, 23 слоя MoE (с 128 экспертами, из которых активируется 6) и 6 слоев GQA-attention, которые единственные хранят KV-cache. Модель использует архитектуру Nemotron 3 Nano, но с совершенно другим рецептом данных.
Обучение на суверенной инфраструктуре
Обучение прошло на промышленном облаке Deutsche Telekom в Мюнхене с 24 марта по 13 мая 2026 года. Использовалось до 512 GPU NVIDIA B200, что дало ~253,000 GPU-часов. Ключевая особенность — доля немецкого языка в данных: если в референсной модели Nemotron на все не-английские языки уходило ~5%, то в Soofi S доля немецкого во втором этапе обучения выросла до 15.32%. Источники данных включают HPLT v3/v4, German Commons, FineWiki и коммерчески лицензированные 193 млн статей из архивов Genios.
Результаты бенчмарков
Soofi S показала лучшие результаты среди полностью открытых базовых моделей (fully open base models). Ниже приведено сравнение с ключевыми конкурентами:
| Бенчмарк | Soofi S 30B-A3B | Olmo 3 32B | Apertus 70B | EuroLLM 22B | Alia 40B |
|---|---|---|---|---|---|
| English Aggregate | 70.1 | 67.3 | 62.4 | 61.2 | 59.0 |
| German Aggregate | 79.1 | 69.2 | 72.8 | 70.6 | 68.4 |
| Held-out (EN / DE) | 41.4 / 41.8 | 33.1 / 36.2 | 27.6 / 33.5 | 30.8 / 33.9 | 28.0 / 29.4 |
| HumanEval (pass@1) | 73.8 | 63.0 | 30.2 | 39.3 | 23.8 |
| MBPP-DE (pass@1) | 84.2 | 70.8 | 50.9 | 59.4 | 45.6 |
| GSM8K | 86.1 | 80.7 | 65.4 | 25.1 | 65.4 |
По сравнению с архитектурно идентичным референсом Nemotron 3 Nano, Soofi S выигрывает 1.8 балла по английскому и 4.2 балла по немецкому языку, что доказывает эффективность нового датасета. Однако модель уступает Qwen3.5 35B-A3B в общих англоязычных метриках (70.3 против 70.1), хотя и лидирует по немецкому (79.1 против 70.3).
Практическое применение
Модель доступна в виде gated preview на Hugging Face. Благодаря поддержке контекстного окна до 1M токенов (на третьем этапе обучения) и высокой скорости декодирования (в 8-9 раз быстрее плотных моделей 14-24B), Soofi S подходит для:
- Обработки немецких документов (страховые полисы, юридические тексты).
- Билингвальной кодогенерации (немецкий промпт — Python код).
- Высоконагруженных систем RAG с длинным контекстом (до 40K-256K токенов).
Весы можно запустить через vLLM или стандартный Hugging Face Transformers с флагом trust_remote_code=True.
Бенчмарки
| Бенчмарк | Soofi S 30B-A3B | Apertus 70B | EuroLLM 22B | Olmo 3 32B |
|---|---|---|---|---|
| English aggregate | 70.1% | 62.4% | 61.2% | 67.3% |
| German aggregate | 79.1% | 72.8% | 70.6% | 69.2% |
| HumanEval (pass@1) | 73.8% | 30.2% | 39.3% | 63% |
| GPQA-Diamond | 43.4% | 27.3% | 30.3% | 33.3% |
| GSM8K | 86.1% | 65.4% | 25.1% | 80.7% |
| GLP-DE | 88.8% | 81.2% | 78.2% | 73% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
