Проблема: Закон опирается на честность
Новые регуляторные рамки, такие как EU AI Act и калифорнийский SB 53, используют количество операций с плавающей запятой (FLOPs) в качестве порога для определения «фронтальных» моделей ИИ. Однако текущее законодательство полагается исключительно на самоотчеты разработчиков. Для международных соглашений это критическая уязвимость: стороны не могут доверять друг другу, а код и данные тренируемой модели должны оставаться конфиденциальными. Необходим независимый технический способ верификации, не требующий доступа к исходному коду.
Методология: Слепая оценка через «побочные каналы»
Автор тестировал метод на узле с двумя GPU Nvidia Tesla V100-SXM2-16GB, соединенными через NVLink. Выбор устаревшего железа позволил получить физический доступ к оборудованию, имитируя архитектуру современных дата-центров. Верификатор («синяя команда») не видит код, но собирает три типа данных в реальном времени:
- Power (W): Потребление энергии каждой GPU (опрос 2 Гц через nvidia-smi).
- Memory Activity (%): Доля циклов активности контроллера памяти (DRAM_ACTIVE).
- NVLink Traffic: Объем переданных байт через шину NVLink (критично для синхронизации градиентов в DDP).
Результаты: Точность и уязвимости
Модель калибровалась на 88 конфигурациях гиперпараметров (ширина модели, глубина слоев, заголовки внимания). На отложенной выборке эстиматор показал медианную абсолютную ошибку (MAE) всего 10.4%. Однако при проведении атак (red-teaming) с целью обмана системы, злоумышленник смог увеличить ошибку до ~25%, а в худшем случае завышение оценки составило 41%.
| Метрика / Сценарий | Значение | Комментарий |
|---|---|---|
| Базовая точность (MAE) | 10.4% | Средняя ошибка на тестовых данных без атак |
| Точность при атаке (MAE) | ~25% | Средняя ошибка при использовании adversarial workloads |
| Максимальное искажение | 41% | Наихудший случай занижения/завышения FLOPs |
| Источники данных | Power, Mem%, NVLink | Сигналы доступны на уровне системы, но не приложения |
Почему это важно
Работа демонстрирует, что верификация вычислительных мощностей ИИ технически возможна без нарушения коммерческой тайны. Хотя текущий MVP уязвим к преднамеренным искажениям, он задает вектор для развития систем мониторинга. Понимание того, как именно можно «обмануть» датчики (через манипуляцию с памятью или трафиком NVLink), позволяет регуляторам и разработчикам создавать более устойчивые протоколы контроля за развитием мощных ИИ-систем.
Источник: LessWrong ↗
