Проблема: CoT как одноразовый промпт
Традиционно цепочки рассуждений (Chain-of-Thought, CoT) используются преимущественно как промпты во время инференса. Сгенерированные «следы» рассуждений редко возвращаются в цикл обучения. Авторы работы (Hongyang He, Jiuming Liu, Victor Sanchez) предлагают преодолеть это ограничение через Semi-supervised Chain-of-Thought Learning (Semi-CoT) — фреймворк, который превращает неразмеченные вопросы в источник псевдо-супервизии.
Механика: Энтропийный гейт
Метод работает по принципу самообучения (self-training), но с жесткой фильтрацией. Для каждого неразмеченного вопроса генерируется несколько вариантов псевдо-CoT. Затем система оценивает семантическую энтропию ответов. Цепочки с низкой энтропией (высокой уверенностью модели) отбираются как надежные примеры для дообучения.
Результаты: Точность и ограничения
Пилотные эксперименты показали, что «энтропийный гейт» действительно отбирает высококачественные данные. Точность псевдо-ответов варьируется от 91,36% до 100%. Однако влияние на финальную точность моделей (student models) оказалось неоднозначным: на некоторых датасетах прирост есть, на других — перенос знаний отрицательный.
| Датасет | Точность псевдо-ответов | Влияние на модель (Transfer) |
|---|---|---|
| GSM8K | Высокая (в диапазоне 91-100%) | Небольшой прирост |
| SVAMP | Высокая (в диапазоне 91-100%) | Небольшой прирост |
| AQuA | Высокая (в диапазоне 91-100%) | Отрицательный перенос (Negative Transfer) |
| MultiArith | Высокая (в диапазоне 91-100%) | Достигнут потолок (Ceiling) |
Вывод
Исследование подтверждает, что неразмеченные вопросы могут служить надежным источником псевдорассуждений. Однако для эффективного использования этого сигнала требуются более совершенные методы отбора демонстраций или архитектуры обучения студентов, способные фильтровать шум, присутствующий даже в «высокоэнтропийно-чистых» выборках.
Источник: arXiv cs.AI ↗
