Исследования8 сентября 2026 г., 23:20 МСК🤖 Auto

Как проверить FLOPs ИИ без доверия: новый метод верификации по потреблению энергии

Исследователь Уильям Фаулер представил MVP-систему оценки вычислительной нагрузки LLM по косвенным сигналам (GPU power, память, NVLink), достигнув точности 89.6% даже при попытках обмана.

Баннер новости 7044

Проблема: Закон опирается на честность

Новые регуляторные рамки, такие как EU AI Act и калифорнийский SB 53, используют количество операций с плавающей запятой (FLOPs) в качестве порога для определения «фронтальных» моделей ИИ. Однако текущее законодательство полагается исключительно на самоотчеты разработчиков. Для международных соглашений это критическая уязвимость: стороны не могут доверять друг другу, а код и данные тренируемой модели должны оставаться конфиденциальными. Необходим независимый технический способ верификации, не требующий доступа к исходному коду.

Методология: Слепая оценка через «побочные каналы»

Автор тестировал метод на узле с двумя GPU Nvidia Tesla V100-SXM2-16GB, соединенными через NVLink. Выбор устаревшего железа позволил получить физический доступ к оборудованию, имитируя архитектуру современных дата-центров. Верификатор («синяя команда») не видит код, но собирает три типа данных в реальном времени:

  • Power (W): Потребление энергии каждой GPU (опрос 2 Гц через nvidia-smi).
  • Memory Activity (%): Доля циклов активности контроллера памяти (DRAM_ACTIVE).
  • NVLink Traffic: Объем переданных байт через шину NVLink (критично для синхронизации градиентов в DDP).

Результаты: Точность и уязвимости

Модель калибровалась на 88 конфигурациях гиперпараметров (ширина модели, глубина слоев, заголовки внимания). На отложенной выборке эстиматор показал медианную абсолютную ошибку (MAE) всего 10.4%. Однако при проведении атак (red-teaming) с целью обмана системы, злоумышленник смог увеличить ошибку до ~25%, а в худшем случае завышение оценки составило 41%.

Метрика / Сценарий Значение Комментарий
Базовая точность (MAE) 10.4% Средняя ошибка на тестовых данных без атак
Точность при атаке (MAE) ~25% Средняя ошибка при использовании adversarial workloads
Максимальное искажение 41% Наихудший случай занижения/завышения FLOPs
Источники данных Power, Mem%, NVLink Сигналы доступны на уровне системы, но не приложения

Почему это важно

Работа демонстрирует, что верификация вычислительных мощностей ИИ технически возможна без нарушения коммерческой тайны. Хотя текущий MVP уязвим к преднамеренным искажениям, он задает вектор для развития систем мониторинга. Понимание того, как именно можно «обмануть» датчики (через манипуляцию с памятью или трафиком NVLink), позволяет регуляторам и разработчикам создавать более устойчивые протоколы контроля за развитием мощных ИИ-систем.

Источник: LessWrong ↗