Исследования8 июля 2026 г., 07:17 МСК🤖 Auto

CSTutorBench: Почему размер модели не гарантирует качество обучения

Исследователи представили CSTutorBench — первый бенчмарк для оценки малых языковых моделей (SLM) как тьюторов в среде программирования VEX VR. Размер параметров оказался менее важен, чем архитектура и промпт-инжиниринг.

Баннер новости 3082

Проблема приватности и стоимости в K-12

Использование больших языковых моделей (LLM) в школьном образовании сталкивается с барьерами: риски утечки данных учеников, высокая стоимость API и зависимость от проприетарных решений. Малые языковые модели (SLM) предлагают альтернативу, но выбор подходящей модели для специфических задач, таких как обучение блочному программированию, затруднен из-за недостатка соответствующих данных в обучающих выборках.

Что такое CSTutorBench

Авторы H. Chad Lane и Bryson Kageler представили CSTutorBench — бенчмарк, оценивающий способность моделей выступать в роли тьюторов в среде VEX VR (блочная робототехника). Оценка проводится по педагогической рубрике, основанной на исследованиях в области обучения, с использованием конвейера LLM-as-a-judge с участием человека (human-in-the-loop).

Ключевые метрики и результаты

В исследовании протестировано 11 моделей с объемом от 4B до 120B параметров. Результаты показали разрыв между поверхностным качеством текста и глубокими педагогическими навыками:

  • Сильные стороны: Модели хорошо справляются с лексикой, тоном и базовым форматированием ответов.
  • Слабые стороны: Модели часто «сливают» готовые ответы (answer leakage) вместо наведения на решение, а также не умеют эффективно анализировать историю отладки (debugging history) ученика.

Важнейший вывод: семейство модели и подход к instruction-tuning (обучению с инструкциями) являются более сильными предикторами качества тьюторства, чем просто количество параметров.

Влияние промпт-инжиниринга

Применение целевой ревизии промптов, основанной на современных исследованиях педагогического инжиниринга, улучшило баллы 10 из 11 протестированных моделей. Это подчеркивает критическую важность контекстно-зависимой настройки даже для малых моделей.

Сравнение подходов к оценке

Критерий оценки Результат тестирования Значимость для внедрения
Поверхностные метрики (тон, лексика) Высокие баллы у большинства моделей Недостаточно для оценки реальной пользы обучения
Педагогическое поведение (избегание спойлеров) Низкие баллы, частые ошибки Ключевой барьер для автономного использования
Анализ истории отладки Сложности у всех моделей Требует доработки контекстного окна и инструкций
Влияние оптимизации промптов Улучшение у 10/11 моделей Позволяет повысить качество без переобучения

Работа опубликована на воркшопе SLM4ED'26 в рамках конференции AIED 2026 в Сеуле.

Источник: arXiv cs.AI ↗