Исследования4 сентября 2026 г., 15:17 МСК🤖 Auto

GPS-Bench: LLM-симуляции политики теперь с доказательной базой

Исследователи представили GPS-Bench — первый бенчмарк для оценки LLM в анализе госполитики, где акторы и их действия извлекаются из реальных документов, а не генерируются как архетипы.

Баннер новости 6772

Проблема валидации симуляций

Анализ политики требует не просто предсказания результата голосования, а понимания того, кто пострадает, как отреагируют акторы и каковы будут последствия. Существующие LLM-симуляции часто страдают от отсутствия связи с реальностью: правдоподобное поведение никогда не сравнивается с наблюдаемыми исходами. GPS-Bench решает эту проблему, привязывая каждую симуляцию к фактам.

Методология: Evidence-Grounded подход

В отличие от традиционных подходов, где персонажи — это просто архетипы, в GPS-Bench акторы реконструируются на основе датированных записей. Персона становится объектом с доказательной базой (provenance). Данные извлекаются из:

  • Законодательных записей;
  • Отчетов о лоббировании;
  • Регуляторных документов и корпоративных заявлений;
  • Экономических данных.

Архитектура оценки: Gold vs Silver

Ключевая особенность бенчмарка — строгое разделение данных для обучения и тестирования, чтобы избежать утечки знаний. Оценка происходит в два этапа:

Тип данных Источник Роль в бенчмарке
Gold (Золотой стандарт) Человеческая аннотация Используется только для финальной оценки точности
Silver (Серебряный стандарт) LLM (отдельная модель) Используется как обучающий сигнал (supervision), но не как тестовые метки

Результаты сравнения методов

GPS-Bench позволяет проводить контролируемое сравнение различных архитектур агентов. Исследователи тестировали совместное рассуждение, независимых агентов, агентов с коммуникацией, графовые методы и fine-tuning. Результаты показали, что:

  • Fine-tuning на заземленных записях дает наилучшие результаты для предсказания воздействия на акторов.
  • Простая декомпозиция задачи не превосходит fine-tuning по точности, но добавляет механизм интерпретации.
  • Агенты с приватными, неидентичными доказательствами формируют коалиции, которые можно проверить против реальных обязательств, зафиксированных в документах.

Значение для индустрии

GPS-Bench превращает вопрос «помогают ли многоагентные симуляции?» в эмпирическую задачу. Он предоставляет общую среду для изучения того, когда именно наличие доказательной базы, точное моделирование акторов и их взаимодействие улучшают предсказание и интерпретацию политических исходов.

Источник: arXiv cs.AI ↗