Что такое «хорошая» литература для ИИ?
Вопрос о критериях литературного качества остается открытым как в гуманитарных науках, так и в вычислительной лингвистике. Новое исследование, представленное на arXiv, предлагает подход к ответу через анализ «скрытых теорий» (implicit theories), которые формируют reasoning-модели Large Language Models (LLM). Автор работы, Биргер Мёль (Birger Moëll), демонстрирует, как модели с включенным режимом рассуждения оценивают тексты, и что именно они считают признаком мастерства.
Методология: от канонов до форумов
В первом исследовании была создана бенчмарк-выборка из 30 реальных текстов, распределенных по шести уровням качества — от классической литературы до анонимных постов на форумах. Модель DeepSeek (тестировалась в 5 репликациях) классифицировала эти тексты с средней точностью 79.3%.
Анализ цепочек рассуждений (reasoning traces) выявил четкий паттерн: модель отдает приоритет намеренности (intentionality) над грамматической правильностью. Для ИИ важнее ремесло, глубина и уникальный голос автора, чем отсутствие ошибок.
Эксперимент с деконструкцией текстов
Во втором исследовании авторы проверили эту «теорию» на практике, систематически ухудшая пять отрывков из классической прозы. Применялись шесть видов манипуляций: упрощение словаря, сглаживание ритма, удаление образов, обобщение голоса, упрощение структуры и их комбинация. Результаты показали, что модель наиболее чувствительна к структурным и голосовым изменениям, а не к лексике.
| Тип деградации текста | Потеря оценки качества (среднее ± отклонение) | Интерпретация |
|---|---|---|
| Упрощение словаря (Vocabulary simplification) | 0.41 ± 0.46 | Минимальное влияние на восприятие качества |
| Упрощение структуры (Structure simplification) | 2.78 | Сильное снижение оценки |
| Обобщение голоса (Voice genericization) | 2.34 | Значительное снижение оценки |
| Комбинированная деградация | -5.64 | Разрушительный эффект, но субаддитивный (не просто сумма) |
Почему это важно?
Результаты подтверждают, что суждения LLM о качестве письма носят холистический характер. Модель не просто ищет сложные слова, она оценивает целостность авторского стиля и архитектурную сложность текста. Это имеет прямые последствия для разработки систем автоматической обратной связи по письму и вычислительной эстетики: чтобы ИИ мог эффективно оценивать или генерировать «хороший» текст, ему необходимо учитывать не только лексику, но и структуру, ритм и уникальность голоса.
Эксперименты также показали, что при сравнении с моделями Qwen QwQ наблюдается та же качественная картина, что указывает на устойчивость этого феномена у современных reasoning-архитектур.
Источник: arXiv cs.CL ↗
