Проблема приватности и стоимости в K-12
Использование больших языковых моделей (LLM) в школьном образовании сталкивается с барьерами: риски утечки данных учеников, высокая стоимость API и зависимость от проприетарных решений. Малые языковые модели (SLM) предлагают альтернативу, но выбор подходящей модели для специфических задач, таких как обучение блочному программированию, затруднен из-за недостатка соответствующих данных в обучающих выборках.
Что такое CSTutorBench
Авторы H. Chad Lane и Bryson Kageler представили CSTutorBench — бенчмарк, оценивающий способность моделей выступать в роли тьюторов в среде VEX VR (блочная робототехника). Оценка проводится по педагогической рубрике, основанной на исследованиях в области обучения, с использованием конвейера LLM-as-a-judge с участием человека (human-in-the-loop).
Ключевые метрики и результаты
В исследовании протестировано 11 моделей с объемом от 4B до 120B параметров. Результаты показали разрыв между поверхностным качеством текста и глубокими педагогическими навыками:
- Сильные стороны: Модели хорошо справляются с лексикой, тоном и базовым форматированием ответов.
- Слабые стороны: Модели часто «сливают» готовые ответы (answer leakage) вместо наведения на решение, а также не умеют эффективно анализировать историю отладки (debugging history) ученика.
Важнейший вывод: семейство модели и подход к instruction-tuning (обучению с инструкциями) являются более сильными предикторами качества тьюторства, чем просто количество параметров.
Влияние промпт-инжиниринга
Применение целевой ревизии промптов, основанной на современных исследованиях педагогического инжиниринга, улучшило баллы 10 из 11 протестированных моделей. Это подчеркивает критическую важность контекстно-зависимой настройки даже для малых моделей.
Сравнение подходов к оценке
| Критерий оценки | Результат тестирования | Значимость для внедрения |
|---|---|---|
| Поверхностные метрики (тон, лексика) | Высокие баллы у большинства моделей | Недостаточно для оценки реальной пользы обучения |
| Педагогическое поведение (избегание спойлеров) | Низкие баллы, частые ошибки | Ключевой барьер для автономного использования |
| Анализ истории отладки | Сложности у всех моделей | Требует доработки контекстного окна и инструкций |
| Влияние оптимизации промптов | Улучшение у 10/11 моделей | Позволяет повысить качество без переобучения |
Работа опубликована на воркшопе SLM4ED'26 в рамках конференции AIED 2026 в Сеуле.
Источник: arXiv cs.AI ↗
