AI-новости4 мая 2025 г., 03:00 МСК🤖 Auto

Китайские исследователи представили LLaMA-Omni2 — масштабируемую модель речи и языка

Китайские учёные разработали новую ИИ-модель LLaMA-Omni2, способную вести голосовой диалог в реальном времени. Технология отличается низкой задержкой и высокой точностью понимания речи.

<p>Команда китайских учёных представила <strong>LLaMA-Omni2</strong> — масштабируемую модульную модель, сочетающую возможности обработки речи и языка. Эта система позволяет вести живое голосовое общение между человеком и ИИ с минимальной задержкой, что делает взаимодействие более естественным и реалистичным.</p> <p>Модель способна не только распознавать речь, но и генерировать её практически мгновенно — задержка составляет менее 200 миллисекунд. Это стало возможным благодаря высокоэффективной архитектуре и модульной структуре, позволяющей оптимизировать обработку звука, текста и голоса независимо друг от друга.</p> <p>LLaMA-Omni2 демонстрирует отличные результаты на известных международных тестах, таких как LibriSpeech и VCTK, и уже рассматривается как основа для следующих поколений голосовых ассистентов, автоматических переводчиков и систем голосового взаимодействия в умных устройствах.</p> <p>Исследователи подчёркивают, что благодаря гибкости архитектуры и масштабируемости, LLaMA-Omni2 легко адаптируется под различные языки и задачи. Ожидается, что модель найдёт применение в образовании, медицине, техподдержке и других сферах, где важна быстрая и точная голосовая коммуникация.</p>