Исследования1 сентября 2026 г., 02:18 МСК🤖 Auto

AI-редакторы не оставляют «стилистического следа», как генераторы

Исследование EMNLP 2026 доказывает: LLM-генерация и LLM-редактирование оставляют принципиально разные стилистические отпечатки. Детекторы, обученные на сгенерированном тексте, часто проваливаются при проверке отредактированного.

Баннер новости 6457

Проблема единого «AI-текста»

Традиционные системы детекции AI-текста опираются на гипотезу, что любой текст, созданный или измененный нейросетью, обладает уникальным «стилистическим следом» (stylometric footprint). Однако исследование Zhengyang Shan, Yukyung Lee и Sophie Hao (принято в EMNLP 2026) показывает, что это упрощение ведет к ложным срабатываниям. Авторы доказывают, что генерация и редактирование — это качественные разные процессы, оставляющие разные метрические отпечатки.

Ключевые метрики: Энтропия и Лексическое разнообразие

Исследование охватило 8 различных LLM и 5 предметных доменов. Были выявлены устойчивые паттерны для генерации, которые исчезают при редактировании:

  • AI-генерация: Характеризуется совместным увеличением энтропии (непредсказуемости) и лексического разнообразия. Это создает четкий маркер, легко отделяющий AI-текст от человеческого.
  • AI-редактирование: Относительно исходного человеческого текста, отредактированная версия показывает лишь незначительный рост лексического разнообразия и снижение энтропии. Совместного скачка, характерного для генерации, не происходит.

Новый доминирующий сигнал: Лексическая плотность

Парадоксально, но признак, который почти не влиял на распознавание сгенерированного текста, стал главным индикатором при редактировании. Лексическая плотность (отношение контента к структуре) стала доминирующим сигналом, ассоциируемым с AI-редактированием. Это означает, что детекторы, настроенные только на энтропию и разнообразие, будут пропускать отредактированные тексты.

Сравнительные данные

Ниже приведена сводка стилистических изменений, выявленных в ходе эксперимента:

Метрика AI-генерация (с нуля) AI-редактирование (человек → AI) Эффективность детекции
Энтропия Значительный рост Снижение Высокая для генерации, низкая для редактирования
Лексическое разнообразие Значительный рост Небольшой рост Высокая для генерации, средняя для редактирования
Лексическая плотность Минимальный вклад Доминирующий сигнал Низкая для генерации, высокая для редактирования

Почему это важно

Результаты исследования ставят под угрозу эффективность существующих антиплагиатных систем и детекторов AI. Если пользователь берет свой черновик и просит LLM «улучшить стиль» или «исправить ошибки», текст может быть успешно пройден детекторами, обученными на чистых сгенерированных данных. Авторы призывают разделять понятия «AI-текст» на два класса: сгенерированный и отредактированный, и разрабатывать для них отдельные модели детекции.

Источник: arXiv cs.CL ↗