Исследования7 сентября 2026 г., 00:17 МСК🤖 Auto

Конец эпохи бенчмарков: OpenAI признала утечку данных GSM-8K в GPT

OpenAI официально подтвердила, что обучающая выборка популярного теста GSM-8K вошла в датасет для обучения моделей GPT. Это ставит под сомнение достоверность большинства существующих метрик эффективности ИИ.

Признание утечки данных

Компания OpenAI официально подтвердила, что данные из набора тестов GSM-8K (Grade School Math 8K) были включены в обучающую выборку для обучения моделей семейства GPT. GSM-8K долгое время считался «золотым стандартом» для оценки способности языковых моделей решать математические задачи начального и среднего уровня. Признание факта попадания тестовых данных в обучающий датасет означает, что высокие результаты моделей в этом бенчмарке могут быть результатом заучивания ответов, а не истинного понимания логики.

Почему это критично для индустрии

Проблема выходит далеко за рамки одного теста. Если данные GSM-8K, которые собирались и публиковались открыто, оказались в тренировочных данных, то логично предположить, что аналогичная ситуация наблюдается и с другими популярными бенчмарками. Это создает системный кризис доверия к метрикам оценки ИИ. Разработчики и исследователи годами использовали эти тесты для сравнения моделей, но теперь эти сравнения могут быть некорректными из-за «утечки» данных (data leakage).

Сравнение статуса бенчмарков

Ниже приведена таблица, иллюстрирующая текущий статус GSM-8K и его влияние на оценку моделей:

Параметр Статус до признания Статус после признания OpenAI
Надежность метрики Высокая (считался объективным тестом) Низкая (риск contamination данных)
Цель теста Оценка математического рассуждения Оценка способности к запоминанию
Влияние на GPT Демонстрация прогресса в reasoning Искусственное завышение результатов

Что делать дальше?

Индустрии необходимо пересмотреть подходы к валидации моделей. Ключевыми шагами станут:

  • Использование динамических датасетов: Тесты, которые обновляются в реальном времени, чтобы исключить возможность предварительного обучения на них.
  • Строгий аудит данных: Внедрение автоматизированных инструментов для проверки пересечения обучающих датасетов с тестовыми наборами (например, использование инструментов типа RAG или специализированных сканеров contamination).
  • Разработка новых метрик: Смещение фокуса с статических тестов на оценку способности модели к обобщению на новых, ранее не виданных данных.

Заключение

Признание OpenAI является сигналом к пересмотру всей экосистемы оценки ИИ. Доверие к бенчмаркам, которые считались неоспоримыми, разрушено. В ближайшие месяцы мы, вероятно, увидим волну новых исследований, направленных на очистку датасетов и создание более устойчивых методов тестирования, которые невозможно «обмануть» заучиванием.

Источник: Towards AI pub ↗