Проблема: Разрозненность инструментов
Лидирующие вычислительные центры управляют петабайтами научных данных, которые требуют сложной трансформации перед использованием в качестве обучающих выборок для ИИ. Существующие решения не объединяют автоматизацию, оценку готовности, отслеживание происхождения (provenance) и развертывание в единый конвейер. Авторы из Oak Ridge National Laboratory (ORNL) и других институтов предлагают решение — REDI (Readiness Evaluation and Data Integration).
Архитектура: Пятиэтапный конвейер
REDI реализует унифицированный пайплайн, состоящий из пяти строгих стадий. Каждая стадия инstrumentирована для обеспечения воспроизводимости и может быть вызвана как агентом (agent-callable skill). Дополнительно поставляется инструмент SetGo для автоматизации соответствия принципам FAIR (Findable, Accessible, Interoperable, Reusable) и публикации каталогов.
Результаты тестирования на суперкомпьютере Frontier
Фреймворк протестирован на данных из климатологии, протеомики, науки о материалах и термоядерного синтеза. Ключевые метрики производительности на суперкомпьютере Frontier (сверхэксафлопсный компьютер) для климатического кейса:
| Параметр | Значение / Результат |
|---|---|
| Масштабируемость | Практически идеальное параллельное масштабирование до 100 узлов |
| Основная узкая горлышко | Ввод-вывод файлов (File I/O) |
| Ключевой оптимизатор | Выбор формата хранения данных |
| Валидация | Выходы подтверждены экспертами предметной области |
Почему это важно
REDI превращает подготовку данных из «бутылочного горлышка» в воспроизводимый и повторно используемый актив сообщества. Профилирование с отслеживанием происхождения показало, что выбор формата данных является первым рычагом оптимизации затрат. Это позволяет ученым быстрее переходить от сбора данных к обучению моделей, не тратя месяцы на ручную очистку и структурирование.
Источник: arXiv cs.AI ↗
