Исследования5 августа 2026 г., 17:18 МСК🤖 Auto

Как распознать AI-текст без моделей: математика и метрики

Исследование показывает, что детекция LLM-генерации возможна на основе статистических аномалий, а не только нейросетей. Разбор ключевых метрик: perplexity, burstiness и синтаксической сложности.

Баннер новости 5134

Проблема «Slop» и ограничения детекторов

В эпоху перенасыщения интернета контентом, сгенерированным большими языковыми моделями (LLM), возникает проблема так называемого «slop» — низкокачественного, шаблонного текста. Традиционные детекторы, такие как GPTZero или Originality.ai, часто дают ложные срабатывания на человеческий текст и пропускают хорошо отредактированный AI-контент. Новые подходы предлагают отказаться от обучения специализированных моделей в пользу анализа математических свойств самого текста.

Ключевые метрики: Perplexity и Burstiness

Основой метода является анализ двух главных характеристик: перплексии (perplexity) и взрывности (burstiness). LLM оптимизированы для предсказания следующего токена с высокой вероятностью, что делает их текст статистически более «гладким» и предсказуемым по сравнению с человеческим.

  • Perplexity (PPL): Мера неопределенности модели. Чем ниже PPL текста относительно базовой модели (например, GPT-2 или Llama), тем выше вероятность его генерации AI. Человеческий текст имеет более высокую PPL из-за непредсказуемости ассоциаций.
  • Burstiness: Вариабельность длины предложений и сложности слов. Люди склонны чередовать короткие и длинные фразы, создавая «ритмический шум». AI-текст часто однороден по структуре, что снижает показатель burstiness.

Синтаксическая сложность и энтропия

Дополнительным индикатором служит энтропия Шеннона в контексте синтаксических деревьев. Исследования показывают, что LLM генерируют предложения с более низкой синтаксической глубиной и меньшим разнообразием структурных паттернов. Это можно измерить через частоту использования определенных синтаксических конструкций (например, пассивного залога или сложных придаточных предложений), которые у людей встречаются реже или в иных комбинациях.

Практическое применение без обучения моделей

Главное преимущество этого подхода — отсутствие необходимости в обучении новых классификаторов. Достаточно использовать существующие базовые модели для расчета метрик. Это делает метод масштабируемым и устойчивым к адаптации: если автор попытается «сбить» детектор, изменив стиль, статистические аномалии в распределении токенов все равно останутся заметными на фоне естественного человеческого хаоса.

Метрика Что измеряет Поведение LLM Поведение Человека
Perplexity (PPL) Предсказуемость токенов Низкая (высокая уверенность) Высокая (непредсказуемость)
Burstiness Вариабельность длины/сложности Низкая (однородность) Высокая (ритмические скачки)
Синтаксическая энтропия Разнообразие структур Ограниченное разнообразие Широкое разнообразие паттернов

Почему это важно?

Понимание математической природы AI-текста позволяет создавать более прозрачные и интерпретируемые системы модерации. Вместо «черного ящика» нейросети мы получаем четкие индикаторы, которые можно использовать для фильтрации спама, проверки академической честности и поддержания качества контента в медиапространстве.

Источник: Towards Data Science ↗