Проблема валидации симуляций
Анализ политики требует не просто предсказания результата голосования, а понимания того, кто пострадает, как отреагируют акторы и каковы будут последствия. Существующие LLM-симуляции часто страдают от отсутствия связи с реальностью: правдоподобное поведение никогда не сравнивается с наблюдаемыми исходами. GPS-Bench решает эту проблему, привязывая каждую симуляцию к фактам.
Методология: Evidence-Grounded подход
В отличие от традиционных подходов, где персонажи — это просто архетипы, в GPS-Bench акторы реконструируются на основе датированных записей. Персона становится объектом с доказательной базой (provenance). Данные извлекаются из:
- Законодательных записей;
- Отчетов о лоббировании;
- Регуляторных документов и корпоративных заявлений;
- Экономических данных.
Архитектура оценки: Gold vs Silver
Ключевая особенность бенчмарка — строгое разделение данных для обучения и тестирования, чтобы избежать утечки знаний. Оценка происходит в два этапа:
| Тип данных | Источник | Роль в бенчмарке |
|---|---|---|
| Gold (Золотой стандарт) | Человеческая аннотация | Используется только для финальной оценки точности |
| Silver (Серебряный стандарт) | LLM (отдельная модель) | Используется как обучающий сигнал (supervision), но не как тестовые метки |
Результаты сравнения методов
GPS-Bench позволяет проводить контролируемое сравнение различных архитектур агентов. Исследователи тестировали совместное рассуждение, независимых агентов, агентов с коммуникацией, графовые методы и fine-tuning. Результаты показали, что:
- Fine-tuning на заземленных записях дает наилучшие результаты для предсказания воздействия на акторов.
- Простая декомпозиция задачи не превосходит fine-tuning по точности, но добавляет механизм интерпретации.
- Агенты с приватными, неидентичными доказательствами формируют коалиции, которые можно проверить против реальных обязательств, зафиксированных в документах.
Значение для индустрии
GPS-Bench превращает вопрос «помогают ли многоагентные симуляции?» в эмпирическую задачу. Он предоставляет общую среду для изучения того, когда именно наличие доказательной базы, точное моделирование акторов и их взаимодействие улучшают предсказание и интерпретацию политических исходов.
Источник: arXiv cs.AI ↗
