Проблема масштабируемости в CFD
В задачах вычислительной гидродинамики (CFD) и геометрического глубокого обучения (GDL) стандартный механизм self-attention требует $O(N^2)$ вычислений, где $N$ — количество дискретизированных точек. Для сеток с 10 000 точек это 100 млн пар, а для миллионных сеток — уже триллион взаимодействий на слой. Прямое применение attention к исходной сетке промышленного уровня невозможно из-за вычислительных ограничений.
Три подхода к оптимизации
Авторы предлагают три архитектуры, которые меняют единицу взаимодействия, позволяя информации обмениваться через меньшие наборы токенов, а не через каждую точку:
- Transolver: Испольует обучаемые физические состояния (learned states) вместо точек.
- UPT (Universal Physics Transformer): Сжимает входные данные в фиксированное латентное пространство через иерархию суперузлов и перцепер-пулинг.
- AB-UPT (Anchor-Based UPT): Применяет полное self-attention только к управляемому набору «якорей» (anchors), а остальные точки запрашивают информацию у них.
Механика Transolver: Срезы, Внимание, Обратный срез
Transolver не назначает точки жестким кластерам. Вместо этого каждая точка получает «мягкие» веса принадлежности к $M$ обучаемым состояниям. Процесс состоит из трех шагов:
- Slice (Разрез): Взвешенная комбинация $N$ признаков точек формирует $M$ токенов состояния (где $M \ll N$).
- Attend (Внимание): Self-attention выполняется только среди $M$ токенов состояния. Сложность снижается с $N^2$ до $M^2$.
- Deslice (Обратный разрез): Обновленная информация распределяется обратно к исходным точкам.
Сравнение архитектур
| Архитектура | Ключевой механизм | Сложность взаимодействия | Особенность |
|---|---|---|---|
| Transolver | Обучаемые физические состояния (M states) | $O(M^2)$ | Точки вносят вклад в несколько состояний одновременно (soft membership) |
| UPT | Иерархия суперузлов + Perceiver pooling | Зависит от латентного размера | Сжатие всего входа в фиксированное латентное пространство до основного вычисления |
| AB-UPT | Якоря (Anchors) | Зависит от числа якорей | Полное attention только между якорями, остальные точки запрашивают их |
Почему это важно
Эти модели не являются последовательными заменами друг друга, а представляют разные способы организации вычислений. Они позволяют применять трансформеры к задачам с десятками миллионов ячеек сетки, сохраняя глобальный контекст, но избегая взрывной сложности. Это критически важно для инженерных приложений, где требуется быстрый анализ влияния изменений геометрии на давление и поток.
Источник: Towards AI pub ↗
