Проблема «System One» и решение LAVOIR
Модели типа TypeSafe Jev и Laya (так называемые «System One») принимают решения за один проход (single-pass), но они бессильны, когда в тексте не хватает ключевых данных. Если контекст неясен, они просто угадывают. LAVOIR (Laya with Value-Of-Information Routing) решает эту проблему, добавляя к входным данным кандидаты на «недостающие слоты». Модель вычисляет не только вероятности ответов, но и ожидаемый прирост точности (Value of Information, VOI) при запросе каждого конкретного слота.
Как работает обучение без человеческих меток
Ключевое преимущество метода — отсутствие необходимости в ручной разметке (human labels). Золотые стандарты решений генерируются через правила схемы (schema rules), LLM лишь вербализует ответы, а другая модель проверяет тексты. Ожидаемый прирост оценивается через регрессию на реализованные выгоды. Для предотвращения завышенных оценок используется ограничение по индексу Джини (Gini-impurity cap), которое гарантирует, что предсказанная ценность не превышает того, что может получить калиброванная модель.
Результаты бенчмарков и производительность
В контролируемых тестах на известных схемах решения LAVOIR статистически неотличимы от предела Байеса. Модель демонстрирует высокую эффективность в выборе вопросов: политика запросов совпадает с жадным оракулом VOI (AUC 0.799 против 0.797). На реальных диалогах (ABCD) один запрос повышает точность на 8.3 пункта, а на датасете SGD частота запросов снижается с 93% до 8.6% благодаря введенному ограничителю.
| Метрика / Датасет | Результат LAVOIR | Сравнение / Примечание |
|---|---|---|
| Точность (ABCD) | +8.3 пункта | При одном реальном обмене вопросами |
| Частота запросов (SGD) | 8.6% | Снижение с 93% благодаря Gini-капу |
| Совпадение с оракулом | AUC 0.799 | Жадный оракул VOI: 0.797 |
| Скорость ответа | 31 мс (медиана) | Тестирование на GPU GH200 |
| Бенчмарки Laya | 7 из 12 выше | Превосходит заявленные результаты Laya |
Практическая значимость
В среднем, задавая не более 0.5 вопроса на диалог, LAVOIR становится на 14.1 пункта точнее моделей, которые никогда не задают уточняющих вопросов. Это открывает путь к созданию более надежных ИИ-ассистентов, которые экономят время пользователя, спрашивая только о действительно критичных деталях, а не заполняя пробелы догадками.
Источник: arXiv cs.AI ↗
