Революция в эффективности: 80B против 284B
Яндекс представил AliceAI-Foundation-80B-A3B-Base — языковую модель, обученную полностью с нуля без использования весов сторонних open-source решений. Ключевое достижение: при общем объеме в 80 миллиардов параметров (из которых активно используется лишь 3 млрд благодаря архитектуре MoE), модель демонстрирует результаты, сопоставимые или превосходящие модели с объемом в 10–30 раз больше.
Создание заняло около полугода. В отличие от предыдущей закрытой модели Alice AI LLM 235B, эта версия не использует инит-веса Qwen3, что позволило оптимизировать архитектуру и гиперпараметры под задачи рассуждений и агентских взаимодействий для Алисы AI.
Бенчмарки: Код, Математика и Факты
Модель показала лидерские позиции на сложных задачах, таких как IMO AnswerBench и LiveCodeBench. Ниже приведено сравнение ключевых метрик на русском языке (RU) и английском (EN) для фактологических и образовательных задач. Жирным выделены победители в каждой строке.
| Бенчмарк | Язык | AliceAI-80B (Наша модель) | DeepSeek-V4-Flash (284B) | GLM-4.5-Air (106B) | Nemotron-3-Super (120B) |
|---|---|---|---|---|---|
| WikiWebFacts (Факты) | Ru | 86,5 | 83,2 | 70,2 | 72,8 |
| HardMultiQA (Факты) | Ru | 67,9 | 65,4 | 48,6 | 54,5 |
| CultCat (Культура) | Ru | 86,5 | 80,7 | 59,1 | 66,3 |
| EduBench Russian | Ru | 74,2 | 67,7 | 39,0 | 44,0 |
| ExpertFactsQA Medicine | Ru | 63,6 | 60,7 | 50,6 | 42,3 |
| ExpertFactsQA Law | Ru | 49,6 | 40,5 | 22,5 | 24,3 |
Архитектурные инновации и обучение
Команда Яндекса провела серию абляционных экспериментов, чтобы стабилизировать обучение MoE-активаций. Основные технические решения:
- Отказ от инит-весов: Обучение с нуля позволило избежать «шума» от чужих архитектур.
- Агентские данные в претрейне: Добавление CRUD-сценариев и поисковых запросов на этапе претрейна (а не только пост-обучения) значительно улучшило агентские навыки.
- Scaling Laws: Пересчет гиперпараметров по законам масштабирования помог избежать взрыва loss-функции, хотя и потребовал новых методов стабилизации активаций.
Почему это важно для разработчиков
Яндекс опубликовал не только веса модели, но и подробный технический отчет. Он содержит:
- Два новых бенчмарка для оценки фактологических знаний на русском языке: WikiWebFacts и HardMultiQA.
- Детальное описание пайплайнов подготовки данных, включая аугментации для медицинских и юридических доменов.
- Анализ ошибок и метрик, которые действительно предсказывают качество после дообучения (в отличие от простого loss на отложенной выборке).
Модель доступна под лицензией Apache 2.0, что делает её пригодной для коммерческого использования и интеграции в корпоративные решения.
Источник: Habr ↗
