Исследования1 сентября 2026 г., 08:16 МСК🤖 Auto

RegDivergence-101: LLM против регуляторных расхождений FDA и EMA

Исследователи представили RegDivergence-101 — первый бенчмарк для оценки способности LLM выявлять противоречия между регуляторными требованиями FDA и EMA в фармацевтике.

Баннер новости 6469

Проблема ручного согласования

Разработка лекарств для рынков США и ЕС требует от спонсоров согласования руководств FDA и EMA. В идеальном случае требования совпадают, но часто они расходятся или один регулятор молчит, пока другой требует действий. Сегодня это ручная работа экспертов по регуляторным вопросам, что создает риски отклонения клинических испытаний в одном из регионов.

Новая задача: классификация расхождений

Авторы вводят задачу обнаружения регуляторных расхождений (Regulatory Divergence Detection). Модель должна проанализировать пару требований (одно от FDA, другое от EMA) и классифицировать их отношение как:

  • AGREE — требования согласованы;
  • DIVERGE — требования противоречат друг другу;
  • SILENT — один регулятор молчит, а другой регулирует (направленно: SILENT_FDA или SILENT_EMA).

Результаты бенчмарка RegDivergence-101

Бенчмарк состоит из 101 пары, аннотированных экспертами (коэффициент Каппа 0.85). Исследователи протестировали четыре метода, показав, что простые LLM-судьи превосходят сложные графовые подходы на текущем этапе:

Метод Macro-F1 95% CI
Lexical Heuristic 0.511 [0.411-0.605]
NLI Cross-encoder 0.233 -
Obligation-level Graph-RAG 0.663 [0.570-0.747]
Flat LLM Judge (Claude Haiku) 0.830 [0.747-0.908]

Ключевые выводы

Класс SILENT семантически различим, но невидим для моделей, основанных только на логическом следовании (entailment). Графовые методы (Graph-RAG) улучшают показатели над лексическими, но уступают плоским LLM-судьям из-за недостатка контекста. Авторы отмечают, что для масштабирования необходима архитектура с построением графов на уровне всего корпуса документов.

Источник: arXiv cs.AI ↗