Проблема «верхнего уровня» в анализе данных
Большие языковые модели (LLM) всё чаще используются как ассистенты в статистике и data science. Однако существующие бенчмарки обычно предполагают, что цель анализа уже четко задана. На практике пользователи приходят с неформальными целями и разрозненными данными, оставляя модели задачу самостоятельно определить, какой статистический тест нужен и какие переменные важны. Авторы работы из arXiv (2026) формализовали этот этап как Statistical Problem Formulation (Формулировка статистической проблемы) и разбили его на два подзадачи:
- Классификация статистической проблемы: определение типа задачи (например, проверка гипотез, регрессия, кластеризация).
- Идентификация переменных и назначение ролей: выбор релевантных колонок из набора данных и определение их функции (зависимая, независимая, контрольная и т.д.).
Структура бенчмарка StatFormBench
Для оценки моделей был создан датасет StatFormBench, основанный на пяти учебниках по статистике и библиотеке кейсов по анализу данных. Он охватывает разнообразные типы проблем, представления данных и сценарии. Всего в бенчмарк вошло 1 013 образцов, распределенных по 20 крупным и 85 мелким категориям статистических задач.
Результаты тестирования 14 моделей
Исследователи протестировали 14 открытых и закрытых LLM в режиме zero-shot. Результаты показали, что ни одна модель не демонстрирует стабильно высоких показателей по обоим подзадачам. Улучшение промптов дало лишь ограниченный или непоследовательный прирост точности.
| Метрика | Лучший результат (Zero-shot) | Комментарий |
|---|---|---|
| Точность классификации (fine-grained) | 72.0% | Даже лучшие модели ошибаются в определении типа статистического теста в 28% случаев. |
| Перекрытие множеств переменных | 63.2% | Модели часто выбирают лишние или пропускают важные переменные для анализа. |
| Количество категорий | 85 (мелких) | Высокая детализация задач делает задачу классификации крайне сложной. |
Почему это важно
Низкие показатели по «верхнеуровневому» этапу (формулировке проблемы) означают, что LLM пока не могут полностью заменить аналитика на этапе подготовки исследования. Ошибки на этом этапе делают бессмысленным последующий код или расчеты, даже если сама модель умеет писать код идеально. Исследователи выложили данные бенчмарка на Hugging Face и код оценки на GitHub, призывая сообщество работать над улучшением способности моделей понимать контекст данных, а не только синтаксис.
Источник: arXiv cs.AI ↗
