Исследования29 сентября 2026 г., 13:20 МСК🤖 Auto

LAVOIR: ИИ, который знает, когда задать вопрос (и какой)

Исследователи представили LAVOIR — модель, способную за один проход оценивать ценность информации. Это позволяет ИИ не гадать, а запрашивать недостающие данные, повышая точность на 14.1% при минимальных затратах.

Баннер новости 8503

Проблема «System One» и решение LAVOIR

Модели типа TypeSafe Jev и Laya (так называемые «System One») принимают решения за один проход (single-pass), но они бессильны, когда в тексте не хватает ключевых данных. Если контекст неясен, они просто угадывают. LAVOIR (Laya with Value-Of-Information Routing) решает эту проблему, добавляя к входным данным кандидаты на «недостающие слоты». Модель вычисляет не только вероятности ответов, но и ожидаемый прирост точности (Value of Information, VOI) при запросе каждого конкретного слота.

Как работает обучение без человеческих меток

Ключевое преимущество метода — отсутствие необходимости в ручной разметке (human labels). Золотые стандарты решений генерируются через правила схемы (schema rules), LLM лишь вербализует ответы, а другая модель проверяет тексты. Ожидаемый прирост оценивается через регрессию на реализованные выгоды. Для предотвращения завышенных оценок используется ограничение по индексу Джини (Gini-impurity cap), которое гарантирует, что предсказанная ценность не превышает того, что может получить калиброванная модель.

Результаты бенчмарков и производительность

В контролируемых тестах на известных схемах решения LAVOIR статистически неотличимы от предела Байеса. Модель демонстрирует высокую эффективность в выборе вопросов: политика запросов совпадает с жадным оракулом VOI (AUC 0.799 против 0.797). На реальных диалогах (ABCD) один запрос повышает точность на 8.3 пункта, а на датасете SGD частота запросов снижается с 93% до 8.6% благодаря введенному ограничителю.

Метрика / Датасет Результат LAVOIR Сравнение / Примечание
Точность (ABCD) +8.3 пункта При одном реальном обмене вопросами
Частота запросов (SGD) 8.6% Снижение с 93% благодаря Gini-капу
Совпадение с оракулом AUC 0.799 Жадный оракул VOI: 0.797
Скорость ответа 31 мс (медиана) Тестирование на GPU GH200
Бенчмарки Laya 7 из 12 выше Превосходит заявленные результаты Laya

Практическая значимость

В среднем, задавая не более 0.5 вопроса на диалог, LAVOIR становится на 14.1 пункта точнее моделей, которые никогда не задают уточняющих вопросов. Это открывает путь к созданию более надежных ИИ-ассистентов, которые экономят время пользователя, спрашивая только о действительно критичных деталях, а не заполняя пробелы догадками.

Источник: arXiv cs.AI ↗