Исследования30 июля 2026 г., 09:16 МСК🤖 Auto

DuplexGen: Как ИИ учится переключаться в диалоге как человек

Исследователи представили DuplexGen — систему, которая генерирует диалоги с адаптивным переключением реплик, подстраиваясь под контекст задачи через калибровку по человеческим предпочтениям.

Баннер новости 4696

Проблема универсальных моделей

В полнодуплексном взаимодействии (full-duplex) критически важно не только *что* говорит ИИ, но и *когда*. Текущие модели часто применяют единый паттерн переключения реплик (turn-taking) независимо от сценария. Это ограничение проистекает из данных: корпусы человеческих разговоров фиксируют естественные паузы, но не содержат явного разделения ролей или сценарных норм, а эвристические методы генерации игнорируют реальные предпочтения пользователей.

Решение: Калибровка предпочтений

Команда авторов (Takyoung Kim, Kang-wook Kim, Sang Hoon Woo, Julia Hirschberg, Gunhee Kim, Dilek Hakkani-Tür) предложила фреймворк DuplexGen. Его суть — в калибровке предсказаний больших языковых моделей (LLM) на основе небольшого набора аннотаций предпочтений человека на уровне отдельных слотов (slot-level). Это позволяет модели учиться не просто «говорить», а соблюдать ритм, диктуемый конкретной задачей.

Экспериментальные результаты

Исследование проводилось в шести задачах, разделенных на кооперативные и конкурентные. Результаты показали системные различия в том, как люди предпочитают переключаться в зависимости от типа взаимодействия. Ниже приведено сравнение подходов:

Метод генерации диалогов Характеристика Результат (соответствие человеческим предпочтениям)
Uncalibrated Prompting Прямой запрос к LLM без дообучения Низкое соответствие; игнорирование контекста задачи
Generic H-H Data Обучение только на общих человеческих корпусах Среднее соответствие; потеря сценарной специфики
DuplexGen Калибровка по малому набору аннотаций предпочтений Высокое соответствие; адаптация под кооперацию/конкуренцию

Почему это важно

Ключевой вывод работы: для создания реалистичного полнодуплексного ИИ важна не столько масштабность корпуса данных, сколько точность калибровки по человеческим предпочтениям. Полнодуплексная модель, обученная на данных, сгенерированных DuplexGen, демонстрирует поведение, которое люди воспринимают как более естественное и предпочтительное. Это открывает путь к созданию голосовых ассистентов, которые не перебивают, но и не молчат в неподходящий момент, адаптируясь под стиль беседы.

Источник: arXiv cs.CL ↗