Масштабная симуляция человеческой разнородности
Традиционное тестирование ИИ-систем и цифровых продуктов сталкивается с двумя проблемами: участие реальных пользователей дорого и медленно, а офлайн-оценки часто игнорируют человеческое разнообразие. Авторы работы MatrAIx (под руководством Xiaomin Li и 92 соавторов) предлагают решение — инфраструктуру для оценки на уровне популяции. Система использует 8.3 миллиарда записей персонажей, каждая из которых описывается 1 290 категориальными измерениями. Это позволяет моделировать не просто «среднего пользователя», а сложную сеть коррелирующих атрибутов, сохраняя реалистичность поведения.
Структура и компоненты платформы
MatrAIx состоит из трех ключевых элементов. Во-первых, база данных Persona 8B, из которой авторы выпустили отфильтрованное ядро (coreset) из ~1 миллиона персонажей (599 847 основанных на реальных данных и 400 000 синтетических). Во-вторых, среда Playground, предоставляющая четыре типа интерфейсов для взаимодействия: опросы, ИИ-чатботы, веб-страницы и мобильные приложения. В-третьих, набор из 1 010 прикладных задач, охватывающих более 25 доменов, включая коммерцию, финансы, здравоохранение и софт.
Результаты валидации и бенчмарки
Для проверки точности симуляции было проведено 18 189 тестовых прогонов по восьми репрезентативным задачам. Персонажами управляли три крупные языковые модели: Claude Opus 4.8, GPT 5.5 и Claude Haiku 4.5. Контрольное исследование из 400 прогонов показало, что персонажи корректно выражали или подавляли заявленное поведение в 91.5% случаев (366 из 400) по десяти атрибутам. Система способна фиксировать тонкие поведенческие паттерны, такие как колебания после повышения цен или готовность продолжать использование сервиса после сбоя ИИ-ассистента.
| Параметр | Значение / Характеристика |
|---|---|
| Общее число персонажей | 8.3 миллиарда |
| Количество измерений профиля | 1 290 категориальных |
| Размер отфильтрованного ядра | ~1 000 000 записей |
| Использованные LLM | Claude Opus 4.8, GPT 5.5, Claude Haiku 4.5 |
| Точность соблюдения поведения | 91.5% (в контрольной выборке 400 trials) |
| Количество прикладных задач | 1 010 (25+ доменов) |
Значение для индустрии
MatrAIx закрывает критическую нишу между дорогими A/B-тестами с реальными людьми и абстрактными синтетическими бенчмарками. Предоставляя энд-ту-энд инфраструктуру, система позволяет разработчикам заранее выявлять проблемы юзабилити, предвзятости и надежности ИИ-агентов в гетерогенной среде, что особенно важно для критических сфер, таких как медицина и финансы.
Источник: arXiv cs.AI ↗
