Исследования10 августа 2026 г., 10:17 МСК🤖 Auto

LLM-критика против текста: как предсказать отбраковку тестовых заданий

Исследователи разработали модель, объединяющую сырой текст заданий и LLM-анализ для автоматической оценки их качества. Точность предсказания отбраковки достигает 75%, но с серьезными ограничениями в выявлении предвзятости.

Баннер новости 5414

Суть проблемы: автоматизация отбора заданий

Автоматическая оценка элементов (Automated Item Evaluation, AIE) призвана заменить или сократить ручной экспертный обзор и полевое тестирование заданий. В исследовании Hotaka Maeda и Yikai Lu рассматривается задача бинарной классификации: принять или отклонить задание на основе его текста. Ключевая инновация — использование не только самого текста задания, но и критики, сгенерированной большой языковой моделью (Qwen3).

Данные и методология

Для обучения использовался датасет из 52 759 заданий по английскому языку (ELA) и математике. 34% из них были навсегда отклонены для операционного использования. Причины отбраковки варьировались: от плохих психометрических свойств до проблем с предвзятостью (bias) и чувствительностью контента.

Были протестированы три подхода:

  • DeBERTaV3-large на сырых текстах заданий.
  • DeBERTa на текстах, обогащенных критикой от Qwen3.
  • Fusion-модель, объединяющая представления из обоих источников.

Результаты: математика против гуманитарных наук

Модель показала значительный разрыв в эффективности между предметами. Математические задания предсказываются гораздо точнее, вероятно, из-за более четкой логики и структуры, тогда как ELA (английский язык/литература) содержит больше субъективных и контекстуальных нюансов.

Метрика Математика ELA (Гуманитарные)
Accuracy (Точность)
F1 Score 0.73 0.51
AUC (Area Under Curve) 0.86 0.72
Средняя чувствительность (при пороге 0.25) 0.91 0.88

Общая Fusion-модель показала лучшие результаты по всем параметрам: Accuracy = 0.75, F1 = 0.64, AUC = 0.80. Специфичность (способность верно определять хорошие задания) составила 0.81, а чувствительность (выявление плохих) — 0.64.

Практическое применение: порог принятия решений

Авторы предлагают гибкий подход к порогу принятия решения. Снижение порога с 0.5 до 0.25 резко повышает чувствительность (до 0.88–0.91), что критически важно в контексте автоматической генерации заданий. В таких сценариях дешевле сгенерировать 1000 заданий и отфильтровать 900 плохих автоматически, чем проверять каждое вручную. Однако это снижает специфичность, увеличивая количество ложноположительных срабатываний.

Главный риск: слепая зона предвзятости

Несмотря на успехи, модель демонстрирует слабые результаты в выявлении заданий, помеченных как предвзятые, несправедливые или недоступные (особенно в ELA). Это подчеркивает, что автоматизация не может полностью заменить человека в вопросах этики и инклюзивности. Текст-ориентированное AIE — мощный инструмент для фильтрации технических и психометрических ошибок, но «социальная проверка» остается за экспертами.

Источник: arXiv cs.AI ↗