Исследования14 августа 2026 г., 14:18 МСК🤖 Auto

Безопасность ИИ на уровне GPU: новая идея от LessWrong

Автор статьи предлагает внедрить проверку безопасности моделей прямо в драйверы NVIDIA CUDA, чтобы предотвратить запуск вредоносных форков на мощных GPU.

Баннер новости 5796

В статье на платформе LessWrong, опубликованной 14 августа 2026 года, автор Майова Осибоду (Mayowa Osibodu) предлагает радикальное решение проблемы безопасности открытых моделей ИИ. Идея заключается в том, чтобы сделать вычислительные мощности GPU (в частности, NVIDIA) «узким горлышком» для распространения опасных моделей. Предлагается внедрить механизм, аналогичный HTTPS-сертификатам, но для загрузки тензоров моделей: GPU будет отказываться выполнять вычисления, если модель не имеет действующего сертификата безопасности.

Проблема открытых весов и кибератак

Ключевая проблема, которую поднимает автор, — это разрыв в безопасности между закрытыми и открытыми моделями. Закрытые модели (например, Claude Opus или Fable) от Anthropic имеют многоуровневую защиту: фильтры ввода/вывода, мониторинг сессий и внутренние механизмы безопасности. Однако мощные агенты на их базе уже используются для масштабных кибератак.

Открытые модели, такие как GLM 5.2, догоняют их по возможностям, но распространяются без инфраструктуры мониторинга. Это создает риск: злоумышленники могут взять открытую модель, «снять» с нее защитные механизмы (fine-tuning для злых целей) и запустить на доступных GPU.

Как это будет работать технически

Предлагается интегрировать проверку в проприетарный драйвер CUDA. Логика проста:

  • Модель должна предоставить криптографически подтвержденный сертификат от доверенного органа (Compliance Authority).
  • Драйвер CUDA проверяет этот сертификат перед загрузкой тензоров в память GPU.
  • Если сертификат отсутствует или просрочен, GPU отказывается выполнять вычисления.

Поскольку новые мощные GPU совместимы только с последними версиями CUDA, это создает естественный барьер для запуска «взломанных» версий моделей, требующих высокой производительности.

Сравнение подходов к безопасности

Метод защиты Где применяется Применимо к Open-Weight
Встроенные механизмы (weights) Внутри модели Да, но легко обходятся
Фильтры ввода/вывода На сервере провайдера Нет (нет контроля над сервером)
Мониторинг сессий На сервере провайдера Нет
Государственная проверка Перед релизом (для закрытых) Сложно (многие модели из Китая)
GPU-Level Compliance (предложение) В драйвере CUDA Да, через сертификат

Ключевые вопросы и риски

Автор признает, что это не панацея, и выделяет несколько критических вопросов:

  1. Кто будет выдавать сертификаты? Кто станет «Центром сертификации» для ИИ?
  2. Как измерить безопасность? В отличие от шифрования, безопасность ИИ — субъективная метрика. Предлагается использовать «целостность модели» как прокси: разрешать только оригинальные веса, запрещая злые форки.
  3. Удар по исследованиям? Жесткое ограничение может помешать ученым и энтузиастам запускать кастомные, но безопасные дообученные модели. Автор предлагает смягчение: требовать сертификат только для моделей уровня ASL-3 (Anthropic Safety Level 3) и выше.
  4. Интересы NVIDIA? Главный вопрос — заставит ли спрос на вычислительные мощности NVIDIA внедрить функцию, которая ограничивает использование их железа. Экономический стимул здесь может перевесить риски, если спрос на «безопасные» вычисления станет массовым.

Источник: LessWrong ↗