Инструменты7 июля 2026 г., 10:18 МСК🤖 Auto

REDI: Автоматизация подготовки данных для научного ИИ

Команда Oak Ridge National Lab представила REDI — фреймворк, превращающий сырые научные данные в формат для обучения ИИ за пять этапов с отслеживанием происхождения.

Баннер новости 3016

Проблема: Разрозненность инструментов

Лидирующие вычислительные центры управляют петабайтами научных данных, которые требуют сложной трансформации перед использованием в качестве обучающих выборок для ИИ. Существующие решения не объединяют автоматизацию, оценку готовности, отслеживание происхождения (provenance) и развертывание в единый конвейер. Авторы из Oak Ridge National Laboratory (ORNL) и других институтов предлагают решение — REDI (Readiness Evaluation and Data Integration).

Архитектура: Пятиэтапный конвейер

REDI реализует унифицированный пайплайн, состоящий из пяти строгих стадий. Каждая стадия инstrumentирована для обеспечения воспроизводимости и может быть вызвана как агентом (agent-callable skill). Дополнительно поставляется инструмент SetGo для автоматизации соответствия принципам FAIR (Findable, Accessible, Interoperable, Reusable) и публикации каталогов.

Результаты тестирования на суперкомпьютере Frontier

Фреймворк протестирован на данных из климатологии, протеомики, науки о материалах и термоядерного синтеза. Ключевые метрики производительности на суперкомпьютере Frontier (сверхэксафлопсный компьютер) для климатического кейса:

Параметр Значение / Результат
Масштабируемость Практически идеальное параллельное масштабирование до 100 узлов
Основная узкая горлышко Ввод-вывод файлов (File I/O)
Ключевой оптимизатор Выбор формата хранения данных
Валидация Выходы подтверждены экспертами предметной области

Почему это важно

REDI превращает подготовку данных из «бутылочного горлышка» в воспроизводимый и повторно используемый актив сообщества. Профилирование с отслеживанием происхождения показало, что выбор формата данных является первым рычагом оптимизации затрат. Это позволяет ученым быстрее переходить от сбора данных к обучению моделей, не тратя месяцы на ручную очистку и структурирование.

Источник: arXiv cs.AI ↗