Проблема: как контролировать «фронтальные» модели?
Ключевым барьером в регулировании ИИ является отсутствие надежных способов проверки заявленных компаниями объемов вычислений. Калифорнийский закон SB 53 и Европейский AI Act используют порог в 10^26 и 10^25 FLOPs (операций с плавающей запятой) соответственно для определения статуса «фронтальной» модели. Однако текущие законы полагаются на самоотчеты разработчиков, что создает риски обхода ограничений. Необходим метод независимой верификации, не раскрывающий коммерческую тайну (архитектуру и данные), но подтверждающий факт масштабных вычислений.
Методология: Side-channel анализ на Jetson Orin Nano
В рамках проекта UChicago Existential Risks Laboratory был создан прототип (MVP) системы мониторинга на базе одноплатного компьютера Nvidia Jetson Orin Nano 8 GB. Поскольку устройство не предназначено для реального обучения больших моделей, использовался скрипт-симулятор, воспроизводящий паттерны нагрузки трансформеров. Верификация строится на анализе побочных каналов (side-channels):
- Энергопотребление (Power): Используется датчик INA3221 для измерения мощности шины VDD_CPU_GPU_CV. Хотя разделение CPU/GPU невозможно, доминирующая нагрузка GPU дает четкий сигнал.
- Использование памяти (Memory Bandwidth): Монитор Actmon фиксирует активность контроллера памяти (EMC). Высокая активность указывает на интенсивный обмен данными между GPU и DRAM, характерный для обучения.
Ключевые гиперпараметры и метрики
Для калибровки модели использовались параметры, имитирующие реалистичные нагрузки. Критерием «фронтальной» нагрузки в эксперименте считалась активность GPU не менее 80% (по данным утилиты tegrastats). Ниже приведены основные переменные, влияющие на вычислительную сложность:
| Параметр | Влияние на вычисления | Примечание |
|---|---|---|
| Model Width (d_model) | Квадратичное увеличение операций | Размер вектора токена |
| Depth (n_layers) | Линейное увеличение | Количество блоков трансформера |
| Sequence Length (seq_len) | Линейное (MLP) / Квадратичное (Attention) | Количество обрабатываемых токенов |
| Batch Size | Линейное увеличение | Количество последовательностей за шаг |
| Numeric Precision | Не влияет на FLOPs (в теории) | Тестировался только FP32 |
Ground Truth и точность оценки
Для сравнения с оценками использовалась библиотека PyTorch FlopCounterMode, которая динамически вычисляет алгоритмические FLOPs, анализируя тензоры. Метод позволяет отличить обучение от инференса и оценить масштаб вычислений, опираясь на корреляцию между энергопотреблением/нагрузкой памяти и известными математическими моделями трансформеров. Это открывает путь к созданию международных механизмов контроля, где верификаторы могут подтверждать соблюдение порогов FLOPs без доступа к исходному коду или данным компаний.
Источник: LessWrong ↗
