Проблема существующих бенчмарков
Современные большие языковые модели (LLM) всё чаще используются как автономные агенты в задачах анализа данных. Однако существующие на рынке тесты имеют критические недостатки: они либо фокусируются на символическом причинно-следственном выводе без работы с реальными данными, либо предлагают задачи анализа данных без строгой причинной структуры. Кроме того, многие наборы данных ограничены курируемыми примерами, что не позволяет оценить способность модели к обобщению на новых, синтетических структурах.
Что такое CausalDS
Авторы — Андреж Лебан (Andrej Leban) и Юэкай Сун (Yuekai Sun) — представили CausalDS, бенчмарк, созданный для оценки причинного мышления в агентах, выполняющих задачи data science. Каждая задача в этом тесте представляет собой сцену, состоящую из:
- Структурной причинной модели (SCM): генерируется систематически, а не копируется из готовых источников.
- Наблюдательных данных: синтетические данные, полученные на основе SCM, с добавлением шума через модель наблюдения для имитации реальных imperfect observations.
- Сюжета: естественный язык, описывающий сцену в реалистичной предметной области.
Ключевая особенность подхода — использование эмпирических распределений из реальных наборов данных для генерации сцен, что снижает риск «причинного попугайства» (causal parrot), когда модель просто запоминает ответы, не понимая логики.
Три ступени причинности по Перлу
Бенчмарк охватывает все три уровня причинного вывода Джерома Перла, интегрируя их с задачами программирования и использования инструментов:
| Ступень (Rung) | Тип задачи | Описание в контексте CausalDS |
|---|---|---|
| Rung 1: Ассоциация | Прогнозирование | Стандартные задачи предсказания на основе наблюдений (наиболее частый тип в наборе). |
| Rung 2: Интервенция | Что, если? | Модель должна предсказать результат вмешательства в систему, используя причинную структуру. |
| Rung 3: Контрфактуалы | Анализ альтернатив | Оценка того, что произошло бы, если бы история развивалась иначе, при фиксированных исходных условиях. |
Оценка отказов и инструментов
В CausalDS отказ от ответа (abstention) рассматривается как полноценный и оцениваемый результат. Если вопрос не имеет обоснованного ответа на основе предоставленных данных и причинной модели, модель должна уметь это признать. Это критически важно для доверия к AI-агентам в профессиональной среде.
Большинство задач требуют написания кода и использования нескольких инструментов (например, библиотек для статистики или визуализации), что делает тест комплексной проверкой не только логики, но и инженерных навыков агента.
Значение для индустрии
Публикация CausalDS закрывает пробел в оценке LLM, отделяя модели, которые просто угадывают ответы по статистическим паттернам, от тех, которые действительно понимают причинно-следственные связи. Для разработчиков AI-агентов это новый стандарт качества, позволяющий измерять надежность систем в сложных сценариях принятия решений.
Источник: arXiv cs.AI ↗
