Исследования4 августа 2026 г., 03:17 МСК🤖 Auto

LLM не понимают сложность: GPT-5.4 занижает уровень задач

Исследование показало, что даже передовые LLM, включая GPT-5.4, не способны точно оценивать сложность тестовых заданий. Они склонны занижать уровень, что ставит под угрозу их использование для генерации образовательного контента.

Баннер новости 5001

Суть проблемы: семантика ≠ сложность

Исследователи из команды Xinyi Wang, Hong Jiao и коллег провели анализ способности больших языковых моделей (LLM) предсказывать уровни сложности заданий на основе теста по чтению и письму. Главная гипотеза заключалась в том, что если модель понимает семантику текста, она должна понимать и его когнитивную нагрузку. Результаты опровергли это: анализ уменьшения размерности (dimension reduction) эмбеддингов показал, что векторы заданий разных уровней сложности смешиваются в единое пространство. Это доказывает, что одной семантической информации недостаточно для точной оценки сложности.

Сравнение моделей: LLM проигрывают специализированным решениям

В исследовании сравнивались различные стратегии промптинга и настройки параметров. Лучший результат среди LLM показала модель GPT-4.1 в режиме zero-shot с температурой 0. Однако даже она уступала специализированной модели ConvBERT и традиционным методам машинного обучения с учителем.

Модель / Подход Метрика (QWK) Ключевая особенность
ConvBERT 0.625 Лучший результат, превосходит LLM
GPT-4.1 (Zero-shot, temp=0) 0.578 Лучший среди LLM, но ниже ConvBERT
Feature-based ML Ниже 0.578 Уступает GPT-4.1, но лучше базовых LLM

Парадокс GPT-5.4: чем умнее, тем «легче»

Наиболее тревожный вывод касается самых современных моделей. Исследователи обнаружили, что GPT-5.4 склонна систематически занижать уровень сложности заданий. По мере роста возможностей модели она начинает воспринимать большинство задач как простые, что делает её непригодной для генерации сложных, «трудных» вопросов. Все протестированные LLM испытывали трудности с маркировкой именно сложных элементов (hard items).

Почему это важно для EdTech и AI-генерации

Точная оценка сложности (item difficulty) критична как для формирующего, так и для суммативного оценивания. Если LLM не могут гарантированно создавать задания заданного уровня сложности из-за внутренней «предвзятости» к упрощению, их использование в автоматизированных системах генерации тестов требует осторожности. Исследование призывает не полагаться исключительно на семантическое понимание текста для контроля качества образовательного контента.

Источник: arXiv cs.CL ↗