Масштаб и содержание датасета
The Well — это не просто набор данных, а комплексная экосистема для ускорения исследований на стыке машинного обучения и вычислительной науки. Коллекция включает 15 ТБ данных, распределенных по 16 различным датасетам. Охватывает широкий спектр доменов: от динамики жидкостей и акустического рассеяния до магнитогидродинамических симуляций внегалактических жидкостей и взрывов сверхновых.
Каждый датасет варьируется по объему от 6.9 ГБ до 5.1 ТБ, что позволяет исследователям выбирать задачи под доступные вычислительные ресурсы. Данные подготовлены совместно с учеными из Flatiron Institute, Университета Колорадо, Кембриджского университета, NYU и других ведущих институтов.
Технические детали и интеграция
Проект предлагает удобную интеграцию через Python-пакет the_well, доступный на PyPI. Разработчики предусмотрели два режима работы:
- Локальная загрузка: Рекомендуется для больших обучающих циклов. Данные скачиваются на диск (требуется свободное место до 5.1 ТБ на один датасет).
- Стриминг с Hugging Face: Позволяет загружать данные напрямую из хабов Hugging Face без предварительного скачивания, что удобно для прототипирования.
Для работы требуется Python 3.10+. Поддерживается установка через pip install the_well или из исходного кода. Для ускорения вычислений рекомендуется использовать CUDA 12.1.
Бенчмарки и модели
В репозитории уже реализованы базовые модели для сравнения, включая архитектуру FNO (Fourier Neural Operator). Однако авторы подчеркивают, что представленные чекпоинты служат лишь простым базовым уровнем (baseline), а не state-of-the-art решением. Цель проекта — стимулировать сообщество к созданию более эффективных архитектур для суррогатного моделирования уравнений в частных производных (PDE).
Важные нюансы использования
Обратите внимание: датасет viscoelastic_instability был деактивирован из-за ошибок обработки. Для корректной работы следует использовать версию viscoelastic_instability_v2. Все модели и данные доступны для загрузки через Hugging Face Hub.
| Параметр | Значение / Описание |
|---|---|
| Общий объем данных | 15 ТБ |
| Количество датасетов | 16 |
| Мин. размер одного датасета | 6.9 ГБ |
| Макс. размер одного датасета | 5.1 ТБ |
| Ключевые домены | Жидкости, биосистемы, акустика, магнитогидродинамика |
| Базовая модель в бенчмарке | FNO (Fourier Neural Operator) |
| Требования к Python | >= 3.10 |
Почему это важно
До появления The Well исследователям приходилось генерировать собственные симуляции, что занимало месяцы вычислительного времени. Этот датасет предоставляет готовую, проверенную «землю» для тестирования новых нейросетевых архитектур, способных заменять традиционные численные решатели. Публикация результатов в NeurIPS 2024 (статья Ruben Ohana и соавторов) закрепляет The Well как эталонный набор данных для задач scientific machine learning.
Источник: Github ↗
