Лаборатория BiodynAI под руководством Игоря Кендюхова (Ihor Kendiukhov) представила централизованный реестр из 109 открытых проблем в сфере механистической интерпретируемости биологических ИИ. Исследование фокусируется на моделях, обученных на геномных последовательностях, протеомных данных, профилях экспрессии генов и пространственных измерениях тканей. Цель — не просто улучшить точность предсказаний, а понять внутренние механизмы работы этих систем, что критически важно для безопасности и научного прогресса.
Три ключевых драйвера исследования
Авторы выделяют три фундаментальные причины, почему механистическая интерпретируемость биологических моделей стала приоритетом:
- Модельные организмы для MI: Биологические ИИ предоставляют «чистый» ground truth (истинные данные) и имеют меньший масштаб по сравнению с LLM, что позволяет отлаживать методы интерпретируемости в контролируемой среде с возможностью переноса результатов на языковые модели.
- Биобезопасность: Модели усваивают сложные биологические знания, которые не видны в их прямых выходах (например, предсказание последовательностей). Без MI невозможно оценить реальные возможности моделей, которые могут быть использованы для создания опасных биологических агентов при тонкой настройке (fine-tuning).
- Усиление человеческого интеллекта: Использование внутренних представлений биологических ИИ для открытия новых биологических закономерностей в масштабе, что может привести к созданию интервенций, усиливающих когнитивные способности человека.
Достигнутые результаты и метрики
BiodynAI уже достигли значимых прорывов, которые служат базой для дальнейших исследований. В частности, они автоматизировали часть исследовательского процесса с помощью агентов, валидирующих гипотезы на биологическом ground truth. Ниже приведены ключевые достижения лаборатории:
| Направление | Достижение BiodynAI | Значение |
|---|---|---|
| Инференция сетей | Лучшая производительность в восстановлении регуляторных сетей генов из одноядерных моделей | Доказана эффективность MI перед традиционными методами |
| Архитектура | Обучены крупнейшие тензорные сети на данных single-cell | Показана высокая интерпретируемость и производительность одновременно |
| Гипотезы | Сгенерирован пакет гипотез для wet-lab валидации | Мост между вычислительной биологией и экспериментальной наукой |
| Оценка | Проведена обширная MI-оценка передовых биологических моделей | Картирование внутренних представлений frontier-моделей |
Призыв к сообществу
Список из 109 задач опубликован на официальном сайте организации и будет регулярно обновляться. Исследователи, готовые взяться за любую из проблем, приглашаются к координации действий. На данный момент проект не имеет финансирования, поэтому работа ведется на волонтерской основе, но автор активно ищет гранты и партнеров для масштабирования успешных пилотных результатов.
Источник: LessWrong ↗
