Проблема бинарного подхода
Современные научные конференции и журналы внедряют сложные правила использования ИИ, которые различаются в зависимости от роли автора (рецензент, редактор, автор) и этапа работы. Однако существующие инструменты детекции ИИ пытаются решить нерешаемую задачу — определить, «написал ли текст ИИ». Авторы новой работы (Jairo Diaz-Rodriguez, Mumin Jia) утверждают, что этот целевой показатель не совпадает с реальными потребностями редакций, которым нужно оценивать соблюдение этических норм, а не классифицировать авторство.
Суть фреймворка Policy-Conditioned AI-Use Detection
Предложенная система переводит фокус с классификации текста на проверку соблюдения политики (policy). В качестве явного входа в модель подается не только текст, но и конкретное правило, которое должно быть проверено. На выходе система генерирует не вердикт «ИИ обнаружен», а отчет, содержащий:
- Гипотезы о характере использования ИИ;
- Доказательную базу (evidence);
- Режим калибровки;
- Уровень неопределенности.
Метрики и бенчмарки
Оценка эффективности новой модели строится на воспроизводимых пайплайнах, генерирующих как compliant (соответствующие правилам), так и non-compliant (нарушающие правила) рабочие процессы. Ключевой метрикой становится True Positive Rate (TPR) при фиксированном заранее False Positive Rate (FPR), который устанавливает сама конференция. Это позволяет редакциям контролировать цену ошибки.
| Параметр | Традиционные детекторы ИИ | Policy-Conditioned Framework |
|---|---|---|
| Цель | Классификация авторства (AI vs Human) | Проверка соблюдения политики (Compliance) |
| Входные данные | Текст документа | Текст + Явное правило (Policy) |
| Результат | Бинарный вердикт | Отчет с гипотезами, доказательствами и неопределенностью |
| Метрика качества | Часто некалиброванная точность | TPR при фиксированном заранее FPR |
Практические ограничения и выводы
Эксперименты в области рецензирования показали, что даже при сильной настройке детектора на допустимых уровнях нарушений, система может фиксировать больше ложных срабатываний на авторах, соблюдающих правила, чем на нарушителях. Это подчеркивает необходимость внедрения структурированного раскрытия информации (structured disclosure) и маршрутизации через утвержденные инструменты с сохранением конфиденциальности рецензентов. Фреймворк позиционирует детектор не как судью, а как аудируемую процедуру с заранее известной ошибкой, которую редакция может защитить.
Источник: arXiv cs.CL ↗
