Релиз модели14 июля 2026 г., 13:47 МСК🤖 Auto

GigaChat 3.1 Audio: 10B-модель с анализом эмоций в голосе

Команда AI-Sage представила новую версию GigaChat 3.1 Audio, способную не только генерировать речь, но и точно распознавать эмоциональную окраску голоса пользователя.

Баннер новости 3535

Новый уровень мультимодальности

Платформа Huggingface пополнилась моделью GigaChat 3.1 Audio-10B-A1.8B, разработанной командой AI-Sage. Это не просто текстовая LLM с голосовым интерфейсом, а специализированная архитектура, интегрирующая функции синтеза речи (TTS) и анализа аудио. Ключевое отличие новой версии — внедренный модуль распознавания эмоций, что позволяет ИИ адаптировать тон и интонацию ответа в зависимости от состояния пользователя.

Архитектура и параметры

Модель построена на базе крупной языковой модели с 10 миллиардами параметров (10B), к которой добавлен аудио-эксперт с 1.8 миллиарда параметров (A1.8B). Такая гибридная структура позволяет обрабатывать сложные аудиоданные, сохраняя при этом высокую скорость генерации текста. Публикация технической документации (Paper ID: 2607.10387) была осуществлена всего 3 дня назад, что указывает на стремительное развитие линейки GigaChat.

Ключевые возможности

Внедрение эмоционального анализа открывает новые сценарии использования в сферах, где важен контекст общения:

  • Психологическая поддержка: ИИ может распознавать стресс или тревогу и менять тон на более поддерживающий.
  • Обучение и тренинги: Анализ эмоций в ролевых играх для отработки навыков переговоров.
  • Кастомизация: Адаптация интерфейса под настроение пользователя (например, более сдержанный ответ при раздражении).

Технические детали

Модель доступна для тестирования и интеграции через платформу Huggingface. Разработчики подчеркивают, что система обучалась на разнообразных датасетах, включающих различные языки и диалекты, что повышает точность распознавания эмоций в реальных условиях общения, а не только в студийных записях.

Характеристика Значение
Название модели GigaChat 3.1 Audio-10B-A1.8B
Разработчик AI-Sage
Базовая LLM 10 Billion параметров
Аудио-модуль 1.8 Billion параметров
Ключевая фича Распознавание эмоций по голосу
Дата публикации 3 дня назад (Paper: 2607.10387)

Запуск GigaChat 3.1 Audio знаменует важный шаг в сторону создания по-настоящему эмпатичных искусственных интеллектов, способных вести диалог на человеческом уровне не только по смыслу, но и по интонации.

Источник: Huggingface ↗