Архитектура и масштаб
Яндекс представил базовую языковую модель AliceAI-Foundation-80B-A3B-Base, обученную полностью с нуля. Ключевая особенность — гибридная архитектура, сочетающая слои KDA (Kernelized Dense Attention) и MoE (Mixture of Experts). Модель содержит 80 млрд параметров всего, но для обработки каждого токена активируется лишь 3 млрд, что обеспечивает высокую эффективность инференса. Поддерживается контекстное окно длиной до 262 144 токенов.
Обучение проводилось на пересобранном корпусе данных, с акцентом на сложные рассуждения и работу с инструментами. Архитектура включает 48 слоев, размер скрытого состояния 2048 и словарь из 129 024 токенов. Используется механизм Multi-Token Prediction (MTP) для ускорения генерации.
Лидерство в русскоязычных задачах
Модель показала выдающиеся результаты в специализированных бенчмарках на русском языке, особенно в задачах на фактические знания и образование. В тестах WikiWebFacts и HardMultiQA AliceAI уверенно опережает такие модели, как Qwen3.5-35B-A3B и Nemotron-3-Super-120B-A12B. В образовательных наборах данных, собранных на основе запросов к Алисе, модель также заняла первые места.
| Бенчмарк (Русский/Специфичный) | AliceAI-Foundation-80B-A3B-Base | Qwen3.5-35B-A3B-Base | GLM-4.5-Air-Base (106B) | Nemotron-3-Super-120B |
|---|---|---|---|---|
| WikiWebFacts (Факты RU) | 86.5 | 62.4 | 70.2 | 72.8 |
| HardMultiQA (Факты RU) | 67.9 | 47.2 | 48.6 | 54.5 |
| CultCat (Культ. факты) | 86.5 | 59.2 | 59.1 | 66.3 |
| EduBench Russian (Образование) | 74.2 | 42.9 | 39.0 | 44.0 |
| EduBench Literature (Литература) | 73.8 | 51.8 | 51.4 | 55.8 |
| EduBench History (История) | 82.0 | 65.9 | 62.8 | 70.2 |
Математика, код и длинные контексты
В задачах на рассуждения и математику модель также демонстрирует высокий уровень. В бенчмарке MATH-500 она набрала 91.1%, что выше результатов Qwen3.5 и Nemotron. В программировании (BigCodeBench) результаты сопоставимы с лидерами. Особое внимание уделено работе с длинным контекстом: в задачах FinQA (128k токенов) и LongMemEval модель показывает стабильные результаты, сопоставимые с более крупными моделями (Nemotron-3-Super-120B).
Как запустить
Веса модели доступны на Hugging Face. Для запуска через Transformers требуется версия 5.16.1 и библиотека flash-linear-attention с поддержкой KDA. Для инференса через vLLM рекомендуется использовать Docker-образ с конфигурацией MTP (Multi-Token Prediction) для ускорения генерации. Модель использует токенизатор LlamaTokenizer (SentencePiece BPE) и поддерживает специальные токены для цепочек рассуждений ([COT_ENABLE], [COT_START], [COT_END]).
Бенчмарки
| Бенчмарк | AliceAI-Foundation-80B-A3B-Base | GLM-4.5-Air-Base (106B-A12B) | Nemotron-3-Super-120B-A12B-Base | Qwen3.5-35B-A3B-Base |
|---|---|---|---|---|
| AIME 2026 pass@32 | 96.7% | — | 90% | 96.7% |
| SuperGPQA CoT | 44.3% | 35.4% | 46.6% | 43.6% |
| MMLU-Pro CoT | 66.8% | 58.4% | 69.9% | 63.2% |
| MATH-500 | 91.1% | 60.2% | 84.8% | 81.9% |
| LiveCodeBench v5-6 pass@1 | 60.4% | — | 34.7% | 51.9% |
| WikiWebFacts | 86.5% | 70.2% | 72.8% | 62.4% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Huggingface ↗
