Исследования6 августа 2026 г., 09:16 МСК🤖 Auto

MatrAIx: 8.3 млрд персонажей для тестирования ИИ

Исследователи представили MatrAIx — инфраструктуру для симуляции поведения 8.3 миллиарда пользователей с уникальными профилями, позволяющую оценивать ИИ-системы без участия реальных людей.

Баннер новости 5189

Масштабная симуляция человеческой разнородности

Традиционное тестирование ИИ-систем и цифровых продуктов сталкивается с двумя проблемами: участие реальных пользователей дорого и медленно, а офлайн-оценки часто игнорируют человеческое разнообразие. Авторы работы MatrAIx (под руководством Xiaomin Li и 92 соавторов) предлагают решение — инфраструктуру для оценки на уровне популяции. Система использует 8.3 миллиарда записей персонажей, каждая из которых описывается 1 290 категориальными измерениями. Это позволяет моделировать не просто «среднего пользователя», а сложную сеть коррелирующих атрибутов, сохраняя реалистичность поведения.

Структура и компоненты платформы

MatrAIx состоит из трех ключевых элементов. Во-первых, база данных Persona 8B, из которой авторы выпустили отфильтрованное ядро (coreset) из ~1 миллиона персонажей (599 847 основанных на реальных данных и 400 000 синтетических). Во-вторых, среда Playground, предоставляющая четыре типа интерфейсов для взаимодействия: опросы, ИИ-чатботы, веб-страницы и мобильные приложения. В-третьих, набор из 1 010 прикладных задач, охватывающих более 25 доменов, включая коммерцию, финансы, здравоохранение и софт.

Результаты валидации и бенчмарки

Для проверки точности симуляции было проведено 18 189 тестовых прогонов по восьми репрезентативным задачам. Персонажами управляли три крупные языковые модели: Claude Opus 4.8, GPT 5.5 и Claude Haiku 4.5. Контрольное исследование из 400 прогонов показало, что персонажи корректно выражали или подавляли заявленное поведение в 91.5% случаев (366 из 400) по десяти атрибутам. Система способна фиксировать тонкие поведенческие паттерны, такие как колебания после повышения цен или готовность продолжать использование сервиса после сбоя ИИ-ассистента.

Параметр Значение / Характеристика
Общее число персонажей 8.3 миллиарда
Количество измерений профиля 1 290 категориальных
Размер отфильтрованного ядра ~1 000 000 записей
Использованные LLM Claude Opus 4.8, GPT 5.5, Claude Haiku 4.5
Точность соблюдения поведения 91.5% (в контрольной выборке 400 trials)
Количество прикладных задач 1 010 (25+ доменов)

Значение для индустрии

MatrAIx закрывает критическую нишу между дорогими A/B-тестами с реальными людьми и абстрактными синтетическими бенчмарками. Предоставляя энд-ту-энд инфраструктуру, система позволяет разработчикам заранее выявлять проблемы юзабилити, предвзятости и надежности ИИ-агентов в гетерогенной среде, что особенно важно для критических сфер, таких как медицина и финансы.

Источник: arXiv cs.AI ↗