Исследования15 сентября 2026 г., 03:18 МСК🤖 Auto

Transolver, UPT и AB-UPT: как снизить сложность внимания в GDL

Три архитектуры (Transolver, UPT, AB-UPT) решают проблему квадратичной сложности self-attention в геометрическом глубоком обучении, заменяя взаимодействие всех точек на работу с малым набором токенов.

Баннер новости 7496

Проблема масштабируемости в CFD

В задачах вычислительной гидродинамики (CFD) и геометрического глубокого обучения (GDL) стандартный механизм self-attention требует $O(N^2)$ вычислений, где $N$ — количество дискретизированных точек. Для сеток с 10 000 точек это 100 млн пар, а для миллионных сеток — уже триллион взаимодействий на слой. Прямое применение attention к исходной сетке промышленного уровня невозможно из-за вычислительных ограничений.

Три подхода к оптимизации

Авторы предлагают три архитектуры, которые меняют единицу взаимодействия, позволяя информации обмениваться через меньшие наборы токенов, а не через каждую точку:

  • Transolver: Испольует обучаемые физические состояния (learned states) вместо точек.
  • UPT (Universal Physics Transformer): Сжимает входные данные в фиксированное латентное пространство через иерархию суперузлов и перцепер-пулинг.
  • AB-UPT (Anchor-Based UPT): Применяет полное self-attention только к управляемому набору «якорей» (anchors), а остальные точки запрашивают информацию у них.

Механика Transolver: Срезы, Внимание, Обратный срез

Transolver не назначает точки жестким кластерам. Вместо этого каждая точка получает «мягкие» веса принадлежности к $M$ обучаемым состояниям. Процесс состоит из трех шагов:

  1. Slice (Разрез): Взвешенная комбинация $N$ признаков точек формирует $M$ токенов состояния (где $M \ll N$).
  2. Attend (Внимание): Self-attention выполняется только среди $M$ токенов состояния. Сложность снижается с $N^2$ до $M^2$.
  3. Deslice (Обратный разрез): Обновленная информация распределяется обратно к исходным точкам.

Сравнение архитектур

Архитектура Ключевой механизм Сложность взаимодействия Особенность
Transolver Обучаемые физические состояния (M states) $O(M^2)$ Точки вносят вклад в несколько состояний одновременно (soft membership)
UPT Иерархия суперузлов + Perceiver pooling Зависит от латентного размера Сжатие всего входа в фиксированное латентное пространство до основного вычисления
AB-UPT Якоря (Anchors) Зависит от числа якорей Полное attention только между якорями, остальные точки запрашивают их

Почему это важно

Эти модели не являются последовательными заменами друг друга, а представляют разные способы организации вычислений. Они позволяют применять трансформеры к задачам с десятками миллионов ячеек сетки, сохраняя глобальный контекст, но избегая взрывной сложности. Это критически важно для инженерных приложений, где требуется быстрый анализ влияния изменений геометрии на давление и поток.

Источник: Towards AI pub ↗