От текста к физическому действию: новая парадигма риска
Самоуправляемые лаборатории (Self-Driving Labs, SDL) — это киберфизические системы, в которых решения языковых моделей (LLM) и ИИ-агентов напрямую преобразуются в физические действия: дозирование реагентов, управление роботизированными руками и запуск аналитического оборудования. Ключевое отличие от традиционной автоматизации заключается в устранении или минимизации человеческого контроля на этапе планирования экспериментов. Это создает уникальную угрозу: ошибка, которая в программном коде остается просто текстом, в SDL может привести к физическим последствиям, включая выбросы токсичных веществ или возгорания.
Три уровня уязвимостей SDL
Автор выделяет три категории рисков, возникающих на разных этапах работы автономной лаборатории:
- In silico (Прогнозирование): Риски закладываются на этапе моделирования. Сюда входит выбор прекурсоров, оценка токсичности и планирование синтеза. Критическая проблема здесь — разрыв между симуляцией и реальностью (Sim2Real). Модели, обученные на чистых литературных данных, часто игнорируют переменные реальной лаборатории: примеси в реагентах технического класса, различия в оборудовании и плохо документированные условия. Это может привести к непредсказуемым экзотермическим реакциям.
- Lab execution (Исполнение): Даже при правильном химическом расчете ИИ может создать риск из-за «непонимания» ограничений оборудования. Например, агент может оптимизировать протокол для максимизации пропускной способности, игнорируя циклы очистки или превышая давление в HPLC-системе. Здесь возникает конфликт целей: оптимизация скорости/выхода продукта против безопасности.
- Deployment (Развертывание): Риски, возникающие при выходе системы в реальную среду. Включают дрейф возможностей (capability drift) при смене конфигурации оборудования, регуляторные различия между странами (запрет прекурсоров) и эффекты масштабирования. Вещество, безопасное в миллиграммах, может стать опасным при синтезе в граммах из-за изменений растворимости или теплоотвода.
Композитные сбои и проблема авторитета
Особую опасность представляют композитные сбои. Отдельные компоненты системы (модель, планировщик, робот) могут быть безопасны по отдельности, но их комбинация приводит к катастрофе из-за рассинхронизации состояний и общих допущений о безопасности. Также важно различать способность (capability) и авторитет (authority). Менее способная модель с полным доступом к оборудованию может быть опаснее более «умной», но ограниченной в правах системы.
Классификация угроз
Для оценки рисков предлагается использовать модели угроз, фокусируясь на базовых возможностях моделей, а не на конкретных примерах. Автор отмечает, что текущий доступ к оборудованию для синтеза опасных веществ (CBRN) остается сложным, но по мере развития SDL этот барьер может резко снизиться. Требуется разработка фреймворков, объединяющих кибербезопасность и стандарты лабораторной безопасности.
Источник: LessWrong ↗
