Проблема ручного согласования
Разработка лекарств для рынков США и ЕС требует от спонсоров согласования руководств FDA и EMA. В идеальном случае требования совпадают, но часто они расходятся или один регулятор молчит, пока другой требует действий. Сегодня это ручная работа экспертов по регуляторным вопросам, что создает риски отклонения клинических испытаний в одном из регионов.
Новая задача: классификация расхождений
Авторы вводят задачу обнаружения регуляторных расхождений (Regulatory Divergence Detection). Модель должна проанализировать пару требований (одно от FDA, другое от EMA) и классифицировать их отношение как:
- AGREE — требования согласованы;
- DIVERGE — требования противоречат друг другу;
- SILENT — один регулятор молчит, а другой регулирует (направленно: SILENT_FDA или SILENT_EMA).
Результаты бенчмарка RegDivergence-101
Бенчмарк состоит из 101 пары, аннотированных экспертами (коэффициент Каппа 0.85). Исследователи протестировали четыре метода, показав, что простые LLM-судьи превосходят сложные графовые подходы на текущем этапе:
| Метод | Macro-F1 | 95% CI |
|---|---|---|
| Lexical Heuristic | 0.511 | [0.411-0.605] |
| NLI Cross-encoder | 0.233 | - |
| Obligation-level Graph-RAG | 0.663 | [0.570-0.747] |
| Flat LLM Judge (Claude Haiku) | 0.830 | [0.747-0.908] |
Ключевые выводы
Класс SILENT семантически различим, но невидим для моделей, основанных только на логическом следовании (entailment). Графовые методы (Graph-RAG) улучшают показатели над лексическими, но уступают плоским LLM-судьям из-за недостатка контекста. Авторы отмечают, что для масштабирования необходима архитектура с построением графов на уровне всего корпуса документов.
Источник: arXiv cs.AI ↗
