Релиз модели22 сентября 2026 г., 17:49 МСК🤖 Auto

Яндекс открыл AliceAI-80B: обгоняет NVIDIA и DeepSeek в коде с 3x меньшими параметрами

Яндекс выпустил под Apache 2.0 новую LLM AliceAI-Foundation-80B-A3B-Base, обученную с нуля. Модель превосходит более крупные аналоги в коде и математике, став шагом к единой рассуждающей модели Алисы.

Баннер новости 8049

Революция в эффективности: 80B против 284B

Яндекс представил AliceAI-Foundation-80B-A3B-Base — языковую модель, обученную полностью с нуля без использования весов сторонних open-source решений. Ключевое достижение: при общем объеме в 80 миллиардов параметров (из которых активно используется лишь 3 млрд благодаря архитектуре MoE), модель демонстрирует результаты, сопоставимые или превосходящие модели с объемом в 10–30 раз больше.

Создание заняло около полугода. В отличие от предыдущей закрытой модели Alice AI LLM 235B, эта версия не использует инит-веса Qwen3, что позволило оптимизировать архитектуру и гиперпараметры под задачи рассуждений и агентских взаимодействий для Алисы AI.

Бенчмарки: Код, Математика и Факты

Модель показала лидерские позиции на сложных задачах, таких как IMO AnswerBench и LiveCodeBench. Ниже приведено сравнение ключевых метрик на русском языке (RU) и английском (EN) для фактологических и образовательных задач. Жирным выделены победители в каждой строке.

Бенчмарк Язык AliceAI-80B (Наша модель) DeepSeek-V4-Flash (284B) GLM-4.5-Air (106B) Nemotron-3-Super (120B)
WikiWebFacts (Факты) Ru 86,5 83,2 70,2 72,8
HardMultiQA (Факты) Ru 67,9 65,4 48,6 54,5
CultCat (Культура) Ru 86,5 80,7 59,1 66,3
EduBench Russian Ru 74,2 67,7 39,0 44,0
ExpertFactsQA Medicine Ru 63,6 60,7 50,6 42,3
ExpertFactsQA Law Ru 49,6 40,5 22,5 24,3

Архитектурные инновации и обучение

Команда Яндекса провела серию абляционных экспериментов, чтобы стабилизировать обучение MoE-активаций. Основные технические решения:

  • Отказ от инит-весов: Обучение с нуля позволило избежать «шума» от чужих архитектур.
  • Агентские данные в претрейне: Добавление CRUD-сценариев и поисковых запросов на этапе претрейна (а не только пост-обучения) значительно улучшило агентские навыки.
  • Scaling Laws: Пересчет гиперпараметров по законам масштабирования помог избежать взрыва loss-функции, хотя и потребовал новых методов стабилизации активаций.

Почему это важно для разработчиков

Яндекс опубликовал не только веса модели, но и подробный технический отчет. Он содержит:

  1. Два новых бенчмарка для оценки фактологических знаний на русском языке: WikiWebFacts и HardMultiQA.
  2. Детальное описание пайплайнов подготовки данных, включая аугментации для медицинских и юридических доменов.
  3. Анализ ошибок и метрик, которые действительно предсказывают качество после дообучения (в отличие от простого loss на отложенной выборке).

Модель доступна под лицензией Apache 2.0, что делает её пригодной для коммерческого использования и интеграции в корпоративные решения.

Источник: Habr ↗