От «черного ящика» к валидации на реальных данных
Традиционные методы валидации биоинформатических инструментов часто ограничиваются проверкой того, предсказаны ли гены, известные как онкогены. CASCADE предлагает иной подход: он проверяет направление изменения экспрессии (up/down-regulation) в соответствии с реальными данными. Для этого используется механизм MCP (Model Context Protocol), который позволяет LLM-агенту корректно формировать запросы к предварительно вычисленным регуляторным сетям ARACNe.
Высокая точность предсказаний для MYC
Ключевым тестом стала модель онкогена MYC. Исследователи использовали амплификацию копий гена как прокси для инверсии knockdown-эффекта и сравнили предсказания с данными опухолей из TCGA. Результаты превзошли базовые пермутационные модели:
| Тип рака | Совпадение предсказаний с реальностью | Статистическая значимость |
|---|---|---|
| BRCA (Рак молочной железы) | 90.0% | p<0.0013 |
| COAD (Колоректальный рак) | 72.0% | p<0.0013 |
| STAD (Рак желудка) | 85.7% | p<0.0013 |
| Мета-когорта METABRIC | 87.2% | — |
Важно отметить: хотя CASCADE не превзошел по абсолютной точности существующие базы знаний (MSigDB) о биологии MYC/E2F, он значительно лучше справляется с определением конкретного направления изменения экспрессии по сравнению с наивным случайным угадыванием.
Генная специфика и ограничения
Расширение тестирования на 15 дополнительных генов выявило важную закономерность: точность CASCADE зависит от типа регулятора.
- Успех: Регуляторы клеточного цикла и пролиферации (например, CCND1) предсказываются точно.
- Провал: Транскрипционные факторы, определяющие идентичность ткани, и паралог CCND2 (циклин D2) consistently fail (постоянно дают сбой).
Валидация LLM-агента
Отдельно оценивалась способность языковых моделей правильно интерпретировать естественный язык и преобразовывать его в вызовы инструментов MCP. Тестирование на 35 запросах показало следующие результаты:
- Локальная модель: 71.4% точных совпадений.
- Большая модель: 85.7% точных совпадений.
Основная проблема — неоднозначные запросы, где модели склонны выбирать неверный тип пертурбации. Авторы отмечают, что это системная ошибка, которую нельзя исправить простой настройкой схемы, так как триггер условия ошибки не возникает в стандартных сценариях.
Источник: arXiv cs.AI ↗
