Исследования2 июля 2026 г., 13:18 МСК🤖 Auto

SEFORA: Почему LLM не могут заменить преподавателя при проверке эссе

Исследователи представили корпус SEFORA и метрику UniMatch, доказав, что современные LLM не справляются с оценкой учебных эссе: лучший результат F1 составил лишь 0.4.

Баннер новости 2798

Проблема масштабируемости обратной связи

Эффективная обратная связь — ключевой драйвер обучения, но ручная проверка эссе требует огромных ресурсов. Языковые модели (LLM) предлагают путь к автоматизации, однако существует два критических пробела: отсутствие публичных корпусов, отражающих реальную практику преподавателей, и отсутствие надежных методов оценки качества сгенерированных комментариев. Исследование, представленное на arXiv (2607.00274), закрывает оба пробела.

Корпус SEFORA: Реальные данные, а не синтетика

Авторы создали SEFORA (Student Essays with Feedback Corpus) — уникальный датасет, основанный на реальных учебных процессах. В отличие от синтетических данных, SEFORA содержит:

  • 564 черновика студенческих эссе различных жанров;
  • 8 240 аннотаций от преподавателей (inline feedback);
  • Связанные промпты, рубрики оценки, баллы и многоэтапные правки студентов.

Это позволяет обучать и тестировать модели на том, как люди реально дают обратную связь, а не на теоретических идеалах.

Метрика UniMatch: Как измерить «качество» комментария?

Стандартные метрики (BLEU, ROUGE) не работают для открытой генерации. Авторы разработали UniMatch — фреймворк оценки, основанный на семантическом соответствии. Алгоритм:

  1. Разбивает сгенерированный и эталонный фидбек на единицы обратной связи (feedback units).
  2. Оценивает семантическое соответствие каждой единицы по критериям, выведенным из аннотаций преподавателей.
  3. Использует оптимальное сопоставление (optimal matching) для расчета интерпретируемых Precision, Recall и F1.

Результаты: LLM провалили тест

В эксперименте было протестировано 74 конфигурации различных LLM. Ни одна настройка не смогла превзойти F1-меру в 0.4. Это указывает на фундаментальную проблему: модели не умеют выделять те аспекты эссе, которые преподаватели считают приоритетными. Более того, производительность падает по мере увеличения объема генерируемого текста — модели «размазывают» внимание.

Метрика / Параметр Значение / Результат Значение для индустрии
Размер корпуса SEFORA 564 эссе, 8 240 аннотаций Крупнейший публичный датасет с реальным фидбеком преподавателей
Лучший F1 (UniMatch) 0.4 Критически низкий показатель: модели не заменяют человека
Количество конфигураций 74 Исследование охватывает множество моделей и настроек
Тренд производительности Деградация при росте объема текста Длинные комментарии LLM менее точны и релевантны

Почему это важно?

Результаты SEFORA служат суровым напоминанием для EdTech-компаний: автоматизация проверки эссе не решена. Пока LLM не научатся выделять приоритетные ошибки так же, как опытный преподаватель, внедрение таких систем в образовательный процесс несет риски снижения качества обучения. Метрика UniMatch становится новым стандартом для оценки качества открытой генерации в образовании.

Источник: arXiv cs.CL ↗