Исследования25 июля 2026 г., 02:18 МСК🤖 Auto

LLM оценивают литературу: как DeepSeek различает стиль и структуру

Исследование Birger Moëll показывает, что reasoning-модели DeepSeek оценивают литературное качество не по словарному запасу, а по структуре и авторскому голосу, достигая 79.3% точности.

Баннер новости 4343

Что такое «хорошая» литература для ИИ?

Вопрос о критериях литературного качества остается открытым как в гуманитарных науках, так и в вычислительной лингвистике. Новое исследование, представленное на arXiv, предлагает подход к ответу через анализ «скрытых теорий» (implicit theories), которые формируют reasoning-модели Large Language Models (LLM). Автор работы, Биргер Мёль (Birger Moëll), демонстрирует, как модели с включенным режимом рассуждения оценивают тексты, и что именно они считают признаком мастерства.

Методология: от канонов до форумов

В первом исследовании была создана бенчмарк-выборка из 30 реальных текстов, распределенных по шести уровням качества — от классической литературы до анонимных постов на форумах. Модель DeepSeek (тестировалась в 5 репликациях) классифицировала эти тексты с средней точностью 79.3%.

Анализ цепочек рассуждений (reasoning traces) выявил четкий паттерн: модель отдает приоритет намеренности (intentionality) над грамматической правильностью. Для ИИ важнее ремесло, глубина и уникальный голос автора, чем отсутствие ошибок.

Эксперимент с деконструкцией текстов

Во втором исследовании авторы проверили эту «теорию» на практике, систематически ухудшая пять отрывков из классической прозы. Применялись шесть видов манипуляций: упрощение словаря, сглаживание ритма, удаление образов, обобщение голоса, упрощение структуры и их комбинация. Результаты показали, что модель наиболее чувствительна к структурным и голосовым изменениям, а не к лексике.

Тип деградации текста Потеря оценки качества (среднее ± отклонение) Интерпретация
Упрощение словаря (Vocabulary simplification) 0.41 ± 0.46 Минимальное влияние на восприятие качества
Упрощение структуры (Structure simplification) 2.78 Сильное снижение оценки
Обобщение голоса (Voice genericization) 2.34 Значительное снижение оценки
Комбинированная деградация -5.64 Разрушительный эффект, но субаддитивный (не просто сумма)

Почему это важно?

Результаты подтверждают, что суждения LLM о качестве письма носят холистический характер. Модель не просто ищет сложные слова, она оценивает целостность авторского стиля и архитектурную сложность текста. Это имеет прямые последствия для разработки систем автоматической обратной связи по письму и вычислительной эстетики: чтобы ИИ мог эффективно оценивать или генерировать «хороший» текст, ему необходимо учитывать не только лексику, но и структуру, ритм и уникальность голоса.

Эксперименты также показали, что при сравнении с моделями Qwen QwQ наблюдается та же качественная картина, что указывает на устойчивость этого феномена у современных reasoning-архитектур.

Источник: arXiv cs.CL ↗