Релиз модели6 июля 2026 г., 15:45 МСК🤖 Auto

GigaChat 3.5 Ultra: 432B параметров, MLA+GatedDeltaNet и рост скорости

Сбер выпустил в open-source новую флагманскую модель GigaChat 3.5 Ultra. При уменьшении числа параметров с 700B до 432B модель стала быстрее, эффективнее по памяти и сильнее в коде и математике благодаря уникальной гибридной архитектуре.

Баннер новости 2957

Архитектурный прорыв: MLA + GatedDeltaNet

Главное нововведение GigaChat 3.5 Ultra — собственная гибридная архитектура, сочетающая Multi-Token Prediction (MTP) и GatedDeltaNet. Это решение позволяет ускорить инференс без потери качества, что критично для моделей такого масштаба. Модель использует примерно в 4 раза меньше KV-кеша на токен по сравнению с предыдущими поколениями, что позволяет загружать в память более чем в два раза больше контекста. Throughput (пропускная способность) вырос на 20%, а за счет дополнительных MTP-голов для self-speculative decoding скорость greedy decoding увеличилась в 2,2 раза.

Сравнение с предшественником

Несмотря на сокращение числа параметров, новая модель превосходит своего предшественника GigaChat 3.1 Ultra. Ниже приведено сравнение ключевых характеристик:

Параметр GigaChat 3.1 Ultra GigaChat 3.5 Ultra
Количество параметров 700 млрд 432 млрд
Архитектура Стандартная MoE Гибридная (MLA + GatedDeltaNet)
Эффективность KV-кеша Базовая В 4 раза меньше на токен
Рост Throughput +20%
Ускорение генерации (MTP) В 2,2 раза (greedy decoding)

Революция в данных: от синтетики к органическому вебу

Команда Сбера отказалась от полной зависимости от синтетических данных, которые на больших масштабах склонны к «схлопыванию» разнообразия. Основной корпус pretrain (52%) теперь состоит из органических текстов, очищенных с помощью LLM-парсинга HTML-документов. Это сохранило формулы, таблицы и структуру, что дало значительный прирост метрик MMLU и MATH. Доля кода увеличилась с 16 до более чем 600 языков программирования, а математика и качественные научные источники занимают 22% и 26% соответственно.

Стабильность обучения на 432B параметров

Обучение модели такого размера потребовало внедрения стабилизирующих механизмов, таких как hidden_z_loss, GatedNorm и клиппинг активаций. Опыт с нестабильным обучением на базе рецепта DeepSeek V3 в предыдущих версиях показал, что просто скопировать архитектуру недостаточно. В GigaChat 3.5 архитектура и рецепт обучения разработаны совместно, что позволило избежать проблем с масштабированием активаций и довести модель до финального качества. Также впервые применено обучение в онлайн-режиме (Online RL) на этапе alignment, что улучшило следование инструкциям и математические способности.

Источник: Habr ↗