Суть проблемы: автоматизация отбора заданий
Автоматическая оценка элементов (Automated Item Evaluation, AIE) призвана заменить или сократить ручной экспертный обзор и полевое тестирование заданий. В исследовании Hotaka Maeda и Yikai Lu рассматривается задача бинарной классификации: принять или отклонить задание на основе его текста. Ключевая инновация — использование не только самого текста задания, но и критики, сгенерированной большой языковой моделью (Qwen3).
Данные и методология
Для обучения использовался датасет из 52 759 заданий по английскому языку (ELA) и математике. 34% из них были навсегда отклонены для операционного использования. Причины отбраковки варьировались: от плохих психометрических свойств до проблем с предвзятостью (bias) и чувствительностью контента.
Были протестированы три подхода:
- DeBERTaV3-large на сырых текстах заданий.
- DeBERTa на текстах, обогащенных критикой от Qwen3.
- Fusion-модель, объединяющая представления из обоих источников.
Результаты: математика против гуманитарных наук
Модель показала значительный разрыв в эффективности между предметами. Математические задания предсказываются гораздо точнее, вероятно, из-за более четкой логики и структуры, тогда как ELA (английский язык/литература) содержит больше субъективных и контекстуальных нюансов.
| Метрика | Математика | ELA (Гуманитарные) |
|---|---|---|
| Accuracy (Точность) | — | — |
| F1 Score | 0.73 | 0.51 |
| AUC (Area Under Curve) | 0.86 | 0.72 |
| Средняя чувствительность (при пороге 0.25) | 0.91 | 0.88 |
Общая Fusion-модель показала лучшие результаты по всем параметрам: Accuracy = 0.75, F1 = 0.64, AUC = 0.80. Специфичность (способность верно определять хорошие задания) составила 0.81, а чувствительность (выявление плохих) — 0.64.
Практическое применение: порог принятия решений
Авторы предлагают гибкий подход к порогу принятия решения. Снижение порога с 0.5 до 0.25 резко повышает чувствительность (до 0.88–0.91), что критически важно в контексте автоматической генерации заданий. В таких сценариях дешевле сгенерировать 1000 заданий и отфильтровать 900 плохих автоматически, чем проверять каждое вручную. Однако это снижает специфичность, увеличивая количество ложноположительных срабатываний.
Главный риск: слепая зона предвзятости
Несмотря на успехи, модель демонстрирует слабые результаты в выявлении заданий, помеченных как предвзятые, несправедливые или недоступные (особенно в ELA). Это подчеркивает, что автоматизация не может полностью заменить человека в вопросах этики и инклюзивности. Текст-ориентированное AIE — мощный инструмент для фильтрации технических и психометрических ошибок, но «социальная проверка» остается за экспертами.
Источник: arXiv cs.AI ↗
