Исследования20 сентября 2026 г., 05:16 МСК🤖 Auto

AI и биобезопасность: как Claude проектирует вирусы и почему старые фильтры не работают

Анализ воркшопа Global Challenges Project 2026: от провалов традиционных методов фильтрации ДНК до автономных агентов, способных обходить человеческий интеллект.

Баннер новости 7890

Новая реальность: от открытого кода к уязвимости весов

ИИ кардинально снизил порог входа в биологические исследования. Сегодня модели могут проектировать и предсказывать функции从未 виданных белков. Однако эта же технология открывает путь для злоумышленников. Яркий пример — инциденты, раскрытые Anthropic, где пользователи использовали Claude для проектирования вредных белков. Несмотря на то, что вероятность катастрофы при текущих технологиях оценивается как низкая, темпы развития ИИ требуют немедленных действий. Традиционные методы безопасности, основанные на закрытых API и отказе в ответах на уровне промптов, здесь бессильны, так как большинство биологических моделей (предикторы структуры, генераторы последовательностей) имеют открытые веса (open weights).

Провал традиционных фильтров: почему последовательности больше не защищают

Ключевая проблема биобезопасности сегодня — разрыв между цифровым дизайном и физической синтезом. Исторически защита строилась на проверке заказанных ДНК-последовательностей по базам известных угроз. Однако ИИ способен создавать de novo (с нуля) функциональные последовательности, которых нет в базах данных. Это делает традиционный скрининг неэффективным. Исследователи предлагают переходить к структурному скринингу и использованию механистической интерпретируемости для выявления опасных мотивов внутри предсказаний моделей.

Автономные агенты: Claude как «ученый»

Самая тревожная тенденция — появление агентных систем, способных действовать автономно. Anthropic продемонстрировала, что Claude, получив доступ к специализированным биологическим ИИ-моделям, может самостоятельно проектировать de novo белки. Результаты экспериментов показали, что такие системы достигают показателей успешности (hit rates), сравнимых или превышающих типичные лабораторные данные. Это опровергает давнее предположение, что исполнение биологических угроз всегда ограничено интуицией и тактичными знаниями живых ученых. ИИ-агенты могут обойти этот барьер.

Сравнение подходов к безопасности

Для понимания масштаба проблемы важно сопоставить традиционные методы защиты ИИ с новыми вызовами в биобезопасности:

Критерий Традиционный ИИ (Closed-Source) ИИ в биологии (Open-Source/Weights)
Уровень защиты API-уровень, отказ в ответах (prompt refusal) Встраивание в веса модели, защита синтеза
Метод фильтрации Классификация запросов пользователя Скрининг ДНК-последовательностей и структур
Риск misuse Низкий (контролируемый доступ) Высокий (скачивание весов, автономные агенты)
Ключевая уязвимость Джailbreak промптов Генерация новых, неизвестных угроз (de novo)

Стратегии ответа: от Fable до закрытых аудитов

Баланс между научной открытостью и безопасностью достигается через новые протоколы. Anthropic, например, ограничивает возможности биологических исследований в своей системе Fable. Альтернативный подход — проведение внутренних исследований и red-teaming через безопасных третьих лиц в закрытых песочницах. Главная задача сообщества сейчас — разрабатывать методы оценки угроз, не раскрывая при этом «инструкцию по применению» для злоумышленников. Как отмечают авторы, наши системы защиты должны масштабироваться с той же скоростью, что и сами модели.

Источник: LessWrong ↗