Релиз модели21 сентября 2026 г., 15:46 МСК🤖 Auto

Яндекс открыл AliceAI-Foundation-80B: 80B параметров, 3B активных и доминирование в русском

Яндекс опубликовал веса базовой LLM AliceAI-Foundation-80B-A3B-Base с гибридной архитектурой KDA+MoE. Модель демонстрирует лидерство в русскоязычных фактологических и образовательных бенчмарках, превосходя аналоги с миллиардами активных параметров.

Баннер новости 7948

Архитектура и масштаб

Яндекс представил базовую языковую модель AliceAI-Foundation-80B-A3B-Base, обученную полностью с нуля. Ключевая особенность — гибридная архитектура, сочетающая слои KDA (Kernelized Dense Attention) и MoE (Mixture of Experts). Модель содержит 80 млрд параметров всего, но для обработки каждого токена активируется лишь 3 млрд, что обеспечивает высокую эффективность инференса. Поддерживается контекстное окно длиной до 262 144 токенов.

Обучение проводилось на пересобранном корпусе данных, с акцентом на сложные рассуждения и работу с инструментами. Архитектура включает 48 слоев, размер скрытого состояния 2048 и словарь из 129 024 токенов. Используется механизм Multi-Token Prediction (MTP) для ускорения генерации.

Лидерство в русскоязычных задачах

Модель показала выдающиеся результаты в специализированных бенчмарках на русском языке, особенно в задачах на фактические знания и образование. В тестах WikiWebFacts и HardMultiQA AliceAI уверенно опережает такие модели, как Qwen3.5-35B-A3B и Nemotron-3-Super-120B-A12B. В образовательных наборах данных, собранных на основе запросов к Алисе, модель также заняла первые места.

Бенчмарк (Русский/Специфичный) AliceAI-Foundation-80B-A3B-Base Qwen3.5-35B-A3B-Base GLM-4.5-Air-Base (106B) Nemotron-3-Super-120B
WikiWebFacts (Факты RU) 86.5 62.4 70.2 72.8
HardMultiQA (Факты RU) 67.9 47.2 48.6 54.5
CultCat (Культ. факты) 86.5 59.2 59.1 66.3
EduBench Russian (Образование) 74.2 42.9 39.0 44.0
EduBench Literature (Литература) 73.8 51.8 51.4 55.8
EduBench History (История) 82.0 65.9 62.8 70.2

Математика, код и длинные контексты

В задачах на рассуждения и математику модель также демонстрирует высокий уровень. В бенчмарке MATH-500 она набрала 91.1%, что выше результатов Qwen3.5 и Nemotron. В программировании (BigCodeBench) результаты сопоставимы с лидерами. Особое внимание уделено работе с длинным контекстом: в задачах FinQA (128k токенов) и LongMemEval модель показывает стабильные результаты, сопоставимые с более крупными моделями (Nemotron-3-Super-120B).

Как запустить

Веса модели доступны на Hugging Face. Для запуска через Transformers требуется версия 5.16.1 и библиотека flash-linear-attention с поддержкой KDA. Для инференса через vLLM рекомендуется использовать Docker-образ с конфигурацией MTP (Multi-Token Prediction) для ускорения генерации. Модель использует токенизатор LlamaTokenizer (SentencePiece BPE) и поддерживает специальные токены для цепочек рассуждений ([COT_ENABLE], [COT_START], [COT_END]).

Бенчмарки

БенчмаркAliceAI-Foundation-80B-A3B-BaseGLM-4.5-Air-Base (106B-A12B)Nemotron-3-Super-120B-A12B-BaseQwen3.5-35B-A3B-Base
AIME 2026 pass@3296.7%90%96.7%
SuperGPQA CoT44.3%35.4%46.6%43.6%
MMLU-Pro CoT66.8%58.4%69.9%63.2%
MATH-50091.1%60.2%84.8%81.9%
LiveCodeBench v5-6 pass@160.4%34.7%51.9%
WikiWebFacts86.5%70.2%72.8%62.4%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Huggingface ↗