Суть проблемы: семантика ≠ сложность
Исследователи из команды Xinyi Wang, Hong Jiao и коллег провели анализ способности больших языковых моделей (LLM) предсказывать уровни сложности заданий на основе теста по чтению и письму. Главная гипотеза заключалась в том, что если модель понимает семантику текста, она должна понимать и его когнитивную нагрузку. Результаты опровергли это: анализ уменьшения размерности (dimension reduction) эмбеддингов показал, что векторы заданий разных уровней сложности смешиваются в единое пространство. Это доказывает, что одной семантической информации недостаточно для точной оценки сложности.
Сравнение моделей: LLM проигрывают специализированным решениям
В исследовании сравнивались различные стратегии промптинга и настройки параметров. Лучший результат среди LLM показала модель GPT-4.1 в режиме zero-shot с температурой 0. Однако даже она уступала специализированной модели ConvBERT и традиционным методам машинного обучения с учителем.
| Модель / Подход | Метрика (QWK) | Ключевая особенность |
|---|---|---|
| ConvBERT | 0.625 | Лучший результат, превосходит LLM |
| GPT-4.1 (Zero-shot, temp=0) | 0.578 | Лучший среди LLM, но ниже ConvBERT |
| Feature-based ML | Ниже 0.578 | Уступает GPT-4.1, но лучше базовых LLM |
Парадокс GPT-5.4: чем умнее, тем «легче»
Наиболее тревожный вывод касается самых современных моделей. Исследователи обнаружили, что GPT-5.4 склонна систематически занижать уровень сложности заданий. По мере роста возможностей модели она начинает воспринимать большинство задач как простые, что делает её непригодной для генерации сложных, «трудных» вопросов. Все протестированные LLM испытывали трудности с маркировкой именно сложных элементов (hard items).
Почему это важно для EdTech и AI-генерации
Точная оценка сложности (item difficulty) критична как для формирующего, так и для суммативного оценивания. Если LLM не могут гарантированно создавать задания заданного уровня сложности из-за внутренней «предвзятости» к упрощению, их использование в автоматизированных системах генерации тестов требует осторожности. Исследование призывает не полагаться исключительно на семантическое понимание текста для контроля качества образовательного контента.
Источник: arXiv cs.CL ↗
