Исследования7 августа 2026 г., 15:18 МСК🤖 Auto

CASCADE: AI-агент для предсказания эффектов генных мутаций

Исследователь Jose A. Bird представил CASCADE — фреймворк, использующий LLM-агентов и MCP для валидации предсказаний влияния генных пертурбаций на реальных данных пациентов TCGA.

Баннер новости 5304

От «черного ящика» к валидации на реальных данных

Традиционные методы валидации биоинформатических инструментов часто ограничиваются проверкой того, предсказаны ли гены, известные как онкогены. CASCADE предлагает иной подход: он проверяет направление изменения экспрессии (up/down-regulation) в соответствии с реальными данными. Для этого используется механизм MCP (Model Context Protocol), который позволяет LLM-агенту корректно формировать запросы к предварительно вычисленным регуляторным сетям ARACNe.

Высокая точность предсказаний для MYC

Ключевым тестом стала модель онкогена MYC. Исследователи использовали амплификацию копий гена как прокси для инверсии knockdown-эффекта и сравнили предсказания с данными опухолей из TCGA. Результаты превзошли базовые пермутационные модели:

Тип рака Совпадение предсказаний с реальностью Статистическая значимость
BRCA (Рак молочной железы) 90.0% p<0.0013
COAD (Колоректальный рак) 72.0% p<0.0013
STAD (Рак желудка) 85.7% p<0.0013
Мета-когорта METABRIC 87.2%

Важно отметить: хотя CASCADE не превзошел по абсолютной точности существующие базы знаний (MSigDB) о биологии MYC/E2F, он значительно лучше справляется с определением конкретного направления изменения экспрессии по сравнению с наивным случайным угадыванием.

Генная специфика и ограничения

Расширение тестирования на 15 дополнительных генов выявило важную закономерность: точность CASCADE зависит от типа регулятора.

  • Успех: Регуляторы клеточного цикла и пролиферации (например, CCND1) предсказываются точно.
  • Провал: Транскрипционные факторы, определяющие идентичность ткани, и паралог CCND2 (циклин D2) consistently fail (постоянно дают сбой).
Это указывает на то, что фреймворк эффективен для «машинерии» деления клеток, но требует доработки для сложных регуляторных сетей.

Валидация LLM-агента

Отдельно оценивалась способность языковых моделей правильно интерпретировать естественный язык и преобразовывать его в вызовы инструментов MCP. Тестирование на 35 запросах показало следующие результаты:

  • Локальная модель: 71.4% точных совпадений.
  • Большая модель: 85.7% точных совпадений.

Основная проблема — неоднозначные запросы, где модели склонны выбирать неверный тип пертурбации. Авторы отмечают, что это системная ошибка, которую нельзя исправить простой настройкой схемы, так как триггер условия ошибки не возникает в стандартных сценариях.

Источник: arXiv cs.AI ↗