Суть эксперимента: проверка на прочность
Авторы исследования провели контролируемый тест четырех популярных AI-ассистентов: Google Gemini, DeepSeek, OpenAI ChatGPT и Anthropic Claude. Целью было не просто спросить мнение, а заставить модели решить задачу прогнозирования, в которую были намеренно встроены четыре специфические «ловушки» (traps). Эти ловушки имитируют реальные проблемы, с которыми сталкиваются аналитики данных: утечку информации из будущего, задержки в отчетности, влияние промо-акций и структурные разрывы в данных.
Четыре типа ловушек, в которые попали модели
Каждая ловушка проверяла конкретный аспект когнитивной способности AI работать с временными рядами и причинно-следственными связями:
- Утечка данных (Data Leakage): В набор данных были включены признаки, которые стали бы известны только после наступления события. Модели должны были игнорировать их, но многие начали использовать их для «подгонки» прогноза.
- Задержки отчетности (Reporting Delays): Данные поступали с задержкой, имитируя реальную бизнес-среду, где информация о продажах или метриках доступна не в реальном времени.
- Эффект промоакций (Promotion Effects): Внедрение искусственных всплесков активности, чтобы проверить, сможет ли AI отделить влияние маркетинга от естественного тренда.
- Структурные разрывы (Structural Breaks): Резкие изменения в паттернах данных, имитирующие смену рынка или кризис, чтобы проверить адаптивность моделей.
Результаты: кто как справился
Исследование показало, что ни одна из моделей не справилась с задачей идеально. Большинство AI-ассистентов продемонстрировали склонность к «галлюцинациям» в логике и неспособности распознать, что некоторые данные являются «запретными» для использования в прогнозе на текущий момент. Особенно ярко проблема утечки данных проявилась у моделей, которые пытались максимизировать точность подгонки, жертвуя обобщающей способностью.
| Модель | Реакция на утечку данных | Сложность с задержками | Общий вердикт |
|---|---|---|---|
| Google Gemini | Использовала запрещенные признаки | Высокая | Требует строгой фильтрации входных данных |
| DeepSeek | Частично игнорировала шум | Средняя | Лучшая адаптация к контексту |
| ChatGPT | Активно использовала будущие данные | Высокая | Склонна к переобучению на тесте |
| Claude | Попыталась объяснить ошибку | Низкая | Наиболее логичный, но консервативный ответ |
Почему это важно для бизнеса
Результаты теста служат предупреждением для компаний, внедряющих AI в процессы бизнес-аналитики. Ожидание, что LLM (Large Language Models) автоматически понимают контекст временных рядов и причинность, ошибочно. Без четкого инструктажа и предварительной очистки данных (feature engineering) AI-ассистенты могут генерировать прогнозы, основанные на «заглядывании в будущее», что приводит к катастрофическим ошибкам в планировании ресурсов и бюджетах. Исследование подчеркивает необходимость гибридного подхода: человек задает структуру и ограничения, AI выполняет вычисления, но всегда требует валидации на предмет логических ловушек.
Источник: Towards Data Science ↗
