Проблема разрозненных данных
Планирование учебного плана (degree pathway) традиционно требует решения двух сложных задач: сначала необходимо реконструировать структуру курсов из каталогов, PDF-файлов и JSON-эндпоинтов, которые не имеют единой схемы, а затем оптимизировать путь студента с учетом требований предпосылки (prerequisites). Попытки объединить эти этапы часто приводят к ошибкам, так как планировщик, управляющий собственным парсингом, может пропустить важные факты, не нужные для текущего плана.
Архитектура KNOWPLAN
Авторы (Shuheng Cao, Weijia Zhang и др.) предложили архитектуру с жестким разделением этапов. Система состоит из двух основных модулей:
- CatalogBrowse: Агенты для извлечения данных. Они сканируют источники без доступа к профилю пользователя, оценивая действия по приросту полезности. Модуль использует модель span-constrained clause-to-AST для парсинга и завершает работу только при получении сертификата полноты индекса и схемы.
- DegreeMap: Модуль оптимизации. Он потребляет только извлеченные JSON-документы, преобразует их в гиперграф требований и использует решатель CP-SAT для лексикографической оптимизации по нескольким критериям: жесткая выполнимость, горизонт завершения, нагрузка, риск и персональная полезность.
Результаты бенчмарков
Эксперименты проводились на двух наборах данных: широком треке (100 университетов) и плотном треке (6 школ). Система демонстрирует выдающиеся метрики эффективности и точности:
| Метрика | Результат KNOWPLAN | Значение |
|---|---|---|
| Inventory Recall (CatalogBrowse) | 96.2% | Почти полное извлечение курсов |
| Masked-source recovery | 88.7% | Восстановление скрытых данных |
| Экономия запросов | 47% | Меньше нагрузки на серверы вузов |
| Hard feasibility (DegreeMap) | 100.0% | Все требования соблюдены |
| Улучшение персональной полезности | +0.066 | Лучше сильнейшего базового уровня |
| Сертификация запросов | 99.5% | Высокая надежность системы |
Почему это важно
KNOWPLAN решает проблему «черного ящика» в образовательных рекомендательных системах. Благодаря разделению этапов извлечения и оптимизации, система гарантирует, что каждый шаг оптимизации происходит внутри оптимума, заданного предыдущим этапом. Разрыв в полезности (utility gap) относительно идеального плана составляет всего 0.015, что делает систему практически идеальной для использования студентами и администраторами вузов.
Источник: arXiv cs.AI ↗
