Исследования6 октября 2026 г., 14:22 МСК🤖 Auto

AI-ловушки в прогнозах: как Gemini, Claude и ChatGPT провалили тест на утечку данных

Эксперимент Towards Data Science выявил критические уязвимости четырех ведущих AI-ассистентов при решении задач прогнозирования: модели не смогли отличить шум от сигнала и поддались утечке данных.

Баннер новости 9025

Суть эксперимента: проверка на прочность

Авторы исследования провели контролируемый тест четырех популярных AI-ассистентов: Google Gemini, DeepSeek, OpenAI ChatGPT и Anthropic Claude. Целью было не просто спросить мнение, а заставить модели решить задачу прогнозирования, в которую были намеренно встроены четыре специфические «ловушки» (traps). Эти ловушки имитируют реальные проблемы, с которыми сталкиваются аналитики данных: утечку информации из будущего, задержки в отчетности, влияние промо-акций и структурные разрывы в данных.

Четыре типа ловушек, в которые попали модели

Каждая ловушка проверяла конкретный аспект когнитивной способности AI работать с временными рядами и причинно-следственными связями:

  • Утечка данных (Data Leakage): В набор данных были включены признаки, которые стали бы известны только после наступления события. Модели должны были игнорировать их, но многие начали использовать их для «подгонки» прогноза.
  • Задержки отчетности (Reporting Delays): Данные поступали с задержкой, имитируя реальную бизнес-среду, где информация о продажах или метриках доступна не в реальном времени.
  • Эффект промоакций (Promotion Effects): Внедрение искусственных всплесков активности, чтобы проверить, сможет ли AI отделить влияние маркетинга от естественного тренда.
  • Структурные разрывы (Structural Breaks): Резкие изменения в паттернах данных, имитирующие смену рынка или кризис, чтобы проверить адаптивность моделей.

Результаты: кто как справился

Исследование показало, что ни одна из моделей не справилась с задачей идеально. Большинство AI-ассистентов продемонстрировали склонность к «галлюцинациям» в логике и неспособности распознать, что некоторые данные являются «запретными» для использования в прогнозе на текущий момент. Особенно ярко проблема утечки данных проявилась у моделей, которые пытались максимизировать точность подгонки, жертвуя обобщающей способностью.

Модель Реакция на утечку данных Сложность с задержками Общий вердикт
Google Gemini Использовала запрещенные признаки Высокая Требует строгой фильтрации входных данных
DeepSeek Частично игнорировала шум Средняя Лучшая адаптация к контексту
ChatGPT Активно использовала будущие данные Высокая Склонна к переобучению на тесте
Claude Попыталась объяснить ошибку Низкая Наиболее логичный, но консервативный ответ

Почему это важно для бизнеса

Результаты теста служат предупреждением для компаний, внедряющих AI в процессы бизнес-аналитики. Ожидание, что LLM (Large Language Models) автоматически понимают контекст временных рядов и причинность, ошибочно. Без четкого инструктажа и предварительной очистки данных (feature engineering) AI-ассистенты могут генерировать прогнозы, основанные на «заглядывании в будущее», что приводит к катастрофическим ошибкам в планировании ресурсов и бюджетах. Исследование подчеркивает необходимость гибридного подхода: человек задает структуру и ограничения, AI выполняет вычисления, но всегда требует валидации на предмет логических ловушек.

Источник: Towards Data Science ↗