AI-новости16 июня 2025 г., 03:00 МСК🤖 Auto

StepFun представила Step-Audio-AQAA — новую эру голосового ИИ без текста

<p> StepFun представила Step-Audio-AQAA — первую полностью сквозную аудиоязыковую модель, способную вести естественный диалог голосом без преобразования в текст. Новинка открывает путь к более выразительным и живым голосовым взаимодейств

<p><strong>StepFun анонсировала Step-Audio-AQAA — первую полностью сквозную аудиоязыковую модель для естественного голосового взаимодействия между человеком и машиной.</strong></p> <p>Современные голосовые ассистенты и системы диалога до сих пор сталкиваются с ограничениями: для понимания и генерации речи они используют цепочку отдельных модулей — распознавание, обработку текста и синтез речи. Такой подход снижает скорость, накапливает ошибки и не позволяет гибко управлять интонацией или эмоциями. Новый прорыв предлагает Step-Audio-AQAA — модель, способную напрямую преобразовывать аудиовопрос в аудиоответ, полностью минуя этапы текстовой обработки.</p> <p>В основе Step-Audio-AQAA лежит уникальная архитектура: два специализированных токенизатора анализируют как лингвистические, так и семантические особенности речи, а затем передают данные в мощную языковую модель Step-Omni с 130 миллиардами параметров. Финальный этап — преобразование токенов в живую, выразительную речь с помощью продвинутого вокодера. Такая система позволяет точно управлять тембром, скоростью и эмоциональной окраской голоса.</p> <p>В ходе тестирования на многоязычном бенчмарке StepEval-Audio-360 новая модель показала лучшие результаты по сравнению с ведущими аналогами, такими как Kimi-Audio и Qwen-Omni. Особенно высоко оценили качество диалога, релевантность и достоверность ответов, а также способность воспроизводить сложные эмоции и интонации.</p> <p>Эксперты отмечают, что появление Step-Audio-AQAA знаменует собой важный этап развития голосовых ИИ: теперь машины могут не только понимать речь, но и отвечать максимально естественно, эмоционально и быстро. Ожидается, что такие технологии найдут применение в голосовых помощниках, аудиокнигах, играх и системах hands-free, делая взаимодействие с ИИ по-настоящему живым и инклюзивным.</p>