Проблема текстовых синтетических данных
Онлайн-покупатели всё чаще используют AI-ассистентов, опираясь на изображения и многошаговые диалоги для уточнения сложных требований к товарам, которые трудно описать текстом. Существующие бенчмарки в основном полагаются на текстовые запросы или синтетические данные, что не отражает реальной сложности покупок. Авторы статьи MMShopBench: A Real-Log Benchmark for Multimodal, Multi-Turn Shopping Agents (arXiv:2607.29002) предлагают решение этой проблемы.
Что такое MMShopBench
Новый датасет построен на основе тщательно очищенных и аннотированных вручную реальных логов покупок. Ключевые особенности:
- Ground-truth аннотации: Каждая запись содержит точные намерения покупки и обязательные требования к продукту.
- Мультимодальность: Агенты должны извлекать требования из комбинации пользовательских изображений и текстового диалога.
- Поиск и верификация: Модель ищет кандидаты через поиск по изображениям и тексту, а затем проверяет соответствие всем требованиям, анализируя изображения товаров и их структурированные атрибуты.
Результаты тестирования
Исследователи оценили как проприетарные, так и открытые модели, используя протокол, основанный на доказательствах (evidence-grounded). Был создан сопутствующий набор данных для дообучения открытой модели. Использование этого набора данных позволило существенно сократить разрыв в производительности между открытыми моделями и ведущими проприетарными решениями.
Значение для индустрии
MMShopBench не только предоставляет стандарт для оценки, но и включает офлайн-песочницу для воспроизводимых экспериментов. Это важный шаг к созданию более надежных и полезных AI-агентов для электронной коммерции, способных понимать контекст и визуальные детали так же хорошо, как и текст.
Источник: arXiv cs.AI ↗
