Исследования4 сентября 2026 г., 20:19 МСК🤖 Auto

Safe(r) Self-Driving Labs: Риски автономных лабораторий и CBRN-угрозы

Ана Ланеску анализирует уязвимости Self-Driving Labs (SDL), где ИИ-агенты управляют физическим оборудованием. Автор выделяет три ключевых вектора риска: от ошибок симуляции до композитных сбоев в цепочке принятия решений.

Баннер новости 6795

От текста к физическому действию: новая парадигма риска

Самоуправляемые лаборатории (Self-Driving Labs, SDL) — это киберфизические системы, в которых решения языковых моделей (LLM) и ИИ-агентов напрямую преобразуются в физические действия: дозирование реагентов, управление роботизированными руками и запуск аналитического оборудования. Ключевое отличие от традиционной автоматизации заключается в устранении или минимизации человеческого контроля на этапе планирования экспериментов. Это создает уникальную угрозу: ошибка, которая в программном коде остается просто текстом, в SDL может привести к физическим последствиям, включая выбросы токсичных веществ или возгорания.

Три уровня уязвимостей SDL

Автор выделяет три категории рисков, возникающих на разных этапах работы автономной лаборатории:

  • In silico (Прогнозирование): Риски закладываются на этапе моделирования. Сюда входит выбор прекурсоров, оценка токсичности и планирование синтеза. Критическая проблема здесь — разрыв между симуляцией и реальностью (Sim2Real). Модели, обученные на чистых литературных данных, часто игнорируют переменные реальной лаборатории: примеси в реагентах технического класса, различия в оборудовании и плохо документированные условия. Это может привести к непредсказуемым экзотермическим реакциям.
  • Lab execution (Исполнение): Даже при правильном химическом расчете ИИ может создать риск из-за «непонимания» ограничений оборудования. Например, агент может оптимизировать протокол для максимизации пропускной способности, игнорируя циклы очистки или превышая давление в HPLC-системе. Здесь возникает конфликт целей: оптимизация скорости/выхода продукта против безопасности.
  • Deployment (Развертывание): Риски, возникающие при выходе системы в реальную среду. Включают дрейф возможностей (capability drift) при смене конфигурации оборудования, регуляторные различия между странами (запрет прекурсоров) и эффекты масштабирования. Вещество, безопасное в миллиграммах, может стать опасным при синтезе в граммах из-за изменений растворимости или теплоотвода.

Композитные сбои и проблема авторитета

Особую опасность представляют композитные сбои. Отдельные компоненты системы (модель, планировщик, робот) могут быть безопасны по отдельности, но их комбинация приводит к катастрофе из-за рассинхронизации состояний и общих допущений о безопасности. Также важно различать способность (capability) и авторитет (authority). Менее способная модель с полным доступом к оборудованию может быть опаснее более «умной», но ограниченной в правах системы.

Классификация угроз

Для оценки рисков предлагается использовать модели угроз, фокусируясь на базовых возможностях моделей, а не на конкретных примерах. Автор отмечает, что текущий доступ к оборудованию для синтеза опасных веществ (CBRN) остается сложным, но по мере развития SDL этот барьер может резко снизиться. Требуется разработка фреймворков, объединяющих кибербезопасность и стандарты лабораторной безопасности.

Источник: LessWrong ↗