Архитектурный прорыв: MLA + GatedDeltaNet
Главное нововведение GigaChat 3.5 Ultra — собственная гибридная архитектура, сочетающая Multi-Token Prediction (MTP) и GatedDeltaNet. Это решение позволяет ускорить инференс без потери качества, что критично для моделей такого масштаба. Модель использует примерно в 4 раза меньше KV-кеша на токен по сравнению с предыдущими поколениями, что позволяет загружать в память более чем в два раза больше контекста. Throughput (пропускная способность) вырос на 20%, а за счет дополнительных MTP-голов для self-speculative decoding скорость greedy decoding увеличилась в 2,2 раза.
Сравнение с предшественником
Несмотря на сокращение числа параметров, новая модель превосходит своего предшественника GigaChat 3.1 Ultra. Ниже приведено сравнение ключевых характеристик:
| Параметр | GigaChat 3.1 Ultra | GigaChat 3.5 Ultra |
|---|---|---|
| Количество параметров | 700 млрд | 432 млрд |
| Архитектура | Стандартная MoE | Гибридная (MLA + GatedDeltaNet) |
| Эффективность KV-кеша | Базовая | В 4 раза меньше на токен |
| Рост Throughput | — | +20% |
| Ускорение генерации (MTP) | — | В 2,2 раза (greedy decoding) |
Революция в данных: от синтетики к органическому вебу
Команда Сбера отказалась от полной зависимости от синтетических данных, которые на больших масштабах склонны к «схлопыванию» разнообразия. Основной корпус pretrain (52%) теперь состоит из органических текстов, очищенных с помощью LLM-парсинга HTML-документов. Это сохранило формулы, таблицы и структуру, что дало значительный прирост метрик MMLU и MATH. Доля кода увеличилась с 16 до более чем 600 языков программирования, а математика и качественные научные источники занимают 22% и 26% соответственно.
Стабильность обучения на 432B параметров
Обучение модели такого размера потребовало внедрения стабилизирующих механизмов, таких как hidden_z_loss, GatedNorm и клиппинг активаций. Опыт с нестабильным обучением на базе рецепта DeepSeek V3 в предыдущих версиях показал, что просто скопировать архитектуру недостаточно. В GigaChat 3.5 архитектура и рецепт обучения разработаны совместно, что позволило избежать проблем с масштабированием активаций и довести модель до финального качества. Также впервые применено обучение в онлайн-режиме (Online RL) на этапе alignment, что улучшило следование инструкциям и математические способности.
Источник: Habr ↗
