Релиз модели19 сентября 2026 г., 17:48 МСК🤖 Auto

Яндекс открыл AliceAI-T5-35B: MoE-модель для быстрого поиска с контекстом 128K

Яндекс опубликовал в Hugging Face базовую языковую модель AliceAI-T5-35B-A0.6B. Это претрейновая архитектура encoder-decoder с разреженными слоями MoE, оптимизированная для генерации быстрых ответов в Поиске.

Баннер новости 7867

Архитектура и ключевые характеристики

AliceAI-T5-35B-A0.6B — это не просто еще одна большая модель, а специализированное решение с архитектурой encoder-decoder и использованием Mixture of Experts (MoE). Модель обучена с нуля и содержит 34,35 млрд уникальных параметров, хотя общее количество параметров в экспертах достигает 35 млрд. Ключевая особенность — в каждом слое MoE работает 512 экспертов, но для обработки каждого токена выбираются только 8 лучших (top-8 routing). Это обеспечивает высокую скорость инференса, критичную для сервисов поисковой выдачи.

Модель поддерживает контекстное окно до 128 000 токенов благодаря позиционным представлениям RoPE с YaRN. Архитектура включает 16 слоев энкодера и 12 слоев декодера с 12 query-головами и 4 KV-головами (GQA), что снижает нагрузку на память.

Результаты бенчмарков: сравнение с аналогами

Яндекс представил результаты тестирования внутренней инфраструктуры. AliceAI-T5-35B демонстрирует сильные показатели в фактологической точности и работе с длинным контекстом, превосходя более мелкие модели (Gemma 2 4B, Qwen 3.5 4B) и конкурируя с Qwen 3.5 35B-A3B. Ниже приведена сводка по ключевым метрикам:

Benchmark Gemma 2 4B Qwen 3.5 4B Qwen 3.5 35B-A3B AliceAI-T5-35B
Factuality (ya) WikiWebFacts 47,2 42,1 62,4 81,3
General (MMLU Pro CoT) 37,4 51,1 63,2 56,3
Math (GSM8K CoT) 58,4 84,5 90,4 84,7
Long Context (Ruler 128K) 81,3 84,4 90,1 81,4
Code (HumanEval) 42,2 74,6 88,3 69,3

Обратите внимание на метрику WikiWebFacts: AliceAI-T5 показывает результат 81,3, значительно опережая конкурентов. Это напрямую связано с задачей модели — обеспечение фактологической точности в поисковых ответах. В то же время в сложных математических задачах (GSM8K) она уступает Qwen 3.5 35B-A3B (84,7 против 90,4), что характерно для специализированных encoder-decoder моделей.

Практическое применение и доступность

Модель доступна на Hugging Face под идентификатором yandex/AliceAI-T5-35B-A0.6B. Загружено уже более 1 030 раз. Для работы требуется установка зависимостей и использование флага trust_remote_code=True из-за кастомной архитектуры.

Разработчики предоставляют два режима использования:

  • Полная модель (Seq2Seq): Для генерации текстовых ответов. Поддерживает квантование и LoRA-дообучение через библиотеку PEFT.
  • Только энкодер: Можно загрузить AliceAIT5MoEEncoderModel для получения эмбеддингов (векторных представлений) текста. Размерность скрытого состояния — 1536. Это полезно для задач семантического поиска и классификации.

Модель поддерживает bfloat16 и требует внимательной настройки device_map для эффективного распределения по GPU. Для дообучения рекомендуется использовать пример finetune_example.py с интеграцией LoRA.

Бенчмарки

БенчмаркAliceAI-T5-35B-A0.6B BaseGemma 4 E4B BaseQwen 3.5 35B-A3B BaseQwen 3.5 4B Base
MMLU (5-shot)78.5%71.7%84.4%77%
GPQA (5-shot)41.3%34%47.1%38.8%
HumanEval (5-shot)69.3%42.2%88.3%74.6%
Ruler 128K81.4%81.3%90.1%84.4%
MATH 500 (CoT, 4-shot)62.9%23.5%81.9%69.5%
GSM8K (CoT, 8-shot)84.7%58.4%90.4%84.5%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Huggingface ↗