Проблема «Slop» и ограничения детекторов
В эпоху перенасыщения интернета контентом, сгенерированным большими языковыми моделями (LLM), возникает проблема так называемого «slop» — низкокачественного, шаблонного текста. Традиционные детекторы, такие как GPTZero или Originality.ai, часто дают ложные срабатывания на человеческий текст и пропускают хорошо отредактированный AI-контент. Новые подходы предлагают отказаться от обучения специализированных моделей в пользу анализа математических свойств самого текста.
Ключевые метрики: Perplexity и Burstiness
Основой метода является анализ двух главных характеристик: перплексии (perplexity) и взрывности (burstiness). LLM оптимизированы для предсказания следующего токена с высокой вероятностью, что делает их текст статистически более «гладким» и предсказуемым по сравнению с человеческим.
- Perplexity (PPL): Мера неопределенности модели. Чем ниже PPL текста относительно базовой модели (например, GPT-2 или Llama), тем выше вероятность его генерации AI. Человеческий текст имеет более высокую PPL из-за непредсказуемости ассоциаций.
- Burstiness: Вариабельность длины предложений и сложности слов. Люди склонны чередовать короткие и длинные фразы, создавая «ритмический шум». AI-текст часто однороден по структуре, что снижает показатель burstiness.
Синтаксическая сложность и энтропия
Дополнительным индикатором служит энтропия Шеннона в контексте синтаксических деревьев. Исследования показывают, что LLM генерируют предложения с более низкой синтаксической глубиной и меньшим разнообразием структурных паттернов. Это можно измерить через частоту использования определенных синтаксических конструкций (например, пассивного залога или сложных придаточных предложений), которые у людей встречаются реже или в иных комбинациях.
Практическое применение без обучения моделей
Главное преимущество этого подхода — отсутствие необходимости в обучении новых классификаторов. Достаточно использовать существующие базовые модели для расчета метрик. Это делает метод масштабируемым и устойчивым к адаптации: если автор попытается «сбить» детектор, изменив стиль, статистические аномалии в распределении токенов все равно останутся заметными на фоне естественного человеческого хаоса.
| Метрика | Что измеряет | Поведение LLM | Поведение Человека |
|---|---|---|---|
| Perplexity (PPL) | Предсказуемость токенов | Низкая (высокая уверенность) | Высокая (непредсказуемость) |
| Burstiness | Вариабельность длины/сложности | Низкая (однородность) | Высокая (ритмические скачки) |
| Синтаксическая энтропия | Разнообразие структур | Ограниченное разнообразие | Широкое разнообразие паттернов |
Почему это важно?
Понимание математической природы AI-текста позволяет создавать более прозрачные и интерпретируемые системы модерации. Вместо «черного ящика» нейросети мы получаем четкие индикаторы, которые можно использовать для фильтрации спама, проверки академической честности и поддержания качества контента в медиапространстве.
Источник: Towards Data Science ↗
