Архитектура и ключевые характеристики
AliceAI-T5-35B-A0.6B — это не просто еще одна большая модель, а специализированное решение с архитектурой encoder-decoder и использованием Mixture of Experts (MoE). Модель обучена с нуля и содержит 34,35 млрд уникальных параметров, хотя общее количество параметров в экспертах достигает 35 млрд. Ключевая особенность — в каждом слое MoE работает 512 экспертов, но для обработки каждого токена выбираются только 8 лучших (top-8 routing). Это обеспечивает высокую скорость инференса, критичную для сервисов поисковой выдачи.
Модель поддерживает контекстное окно до 128 000 токенов благодаря позиционным представлениям RoPE с YaRN. Архитектура включает 16 слоев энкодера и 12 слоев декодера с 12 query-головами и 4 KV-головами (GQA), что снижает нагрузку на память.
Результаты бенчмарков: сравнение с аналогами
Яндекс представил результаты тестирования внутренней инфраструктуры. AliceAI-T5-35B демонстрирует сильные показатели в фактологической точности и работе с длинным контекстом, превосходя более мелкие модели (Gemma 2 4B, Qwen 3.5 4B) и конкурируя с Qwen 3.5 35B-A3B. Ниже приведена сводка по ключевым метрикам:
| Benchmark | Gemma 2 4B | Qwen 3.5 4B | Qwen 3.5 35B-A3B | AliceAI-T5-35B |
|---|---|---|---|---|
| Factuality (ya) WikiWebFacts | 47,2 | 42,1 | 62,4 | 81,3 |
| General (MMLU Pro CoT) | 37,4 | 51,1 | 63,2 | 56,3 |
| Math (GSM8K CoT) | 58,4 | 84,5 | 90,4 | 84,7 |
| Long Context (Ruler 128K) | 81,3 | 84,4 | 90,1 | 81,4 |
| Code (HumanEval) | 42,2 | 74,6 | 88,3 | 69,3 |
Обратите внимание на метрику WikiWebFacts: AliceAI-T5 показывает результат 81,3, значительно опережая конкурентов. Это напрямую связано с задачей модели — обеспечение фактологической точности в поисковых ответах. В то же время в сложных математических задачах (GSM8K) она уступает Qwen 3.5 35B-A3B (84,7 против 90,4), что характерно для специализированных encoder-decoder моделей.
Практическое применение и доступность
Модель доступна на Hugging Face под идентификатором yandex/AliceAI-T5-35B-A0.6B. Загружено уже более 1 030 раз. Для работы требуется установка зависимостей и использование флага trust_remote_code=True из-за кастомной архитектуры.
Разработчики предоставляют два режима использования:
- Полная модель (Seq2Seq): Для генерации текстовых ответов. Поддерживает квантование и LoRA-дообучение через библиотеку PEFT.
- Только энкодер: Можно загрузить
AliceAIT5MoEEncoderModelдля получения эмбеддингов (векторных представлений) текста. Размерность скрытого состояния — 1536. Это полезно для задач семантического поиска и классификации.
Модель поддерживает bfloat16 и требует внимательной настройки device_map для эффективного распределения по GPU. Для дообучения рекомендуется использовать пример finetune_example.py с интеграцией LoRA.
Бенчмарки
| Бенчмарк | AliceAI-T5-35B-A0.6B Base | Gemma 4 E4B Base | Qwen 3.5 35B-A3B Base | Qwen 3.5 4B Base |
|---|---|---|---|---|
| MMLU (5-shot) | 78.5% | 71.7% | 84.4% | 77% |
| GPQA (5-shot) | 41.3% | 34% | 47.1% | 38.8% |
| HumanEval (5-shot) | 69.3% | 42.2% | 88.3% | 74.6% |
| Ruler 128K | 81.4% | 81.3% | 90.1% | 84.4% |
| MATH 500 (CoT, 4-shot) | 62.9% | 23.5% | 81.9% | 69.5% |
| GSM8K (CoT, 8-shot) | 84.7% | 58.4% | 90.4% | 84.5% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Huggingface ↗
