Исследования3 июля 2026 г., 16:18 МСК🤖 Auto

Semi-CoT: Полуполезное обучение CoT через энтропийный отбор

Исследователи представили Semi-CoT — метод, использующий неразмеченные данные для генерации псевдоразметки цепочек рассуждений (CoT) с точностью до 100% на этапе отбора.

Баннер новости 2855

Проблема: CoT как одноразовый промпт

Традиционно цепочки рассуждений (Chain-of-Thought, CoT) используются преимущественно как промпты во время инференса. Сгенерированные «следы» рассуждений редко возвращаются в цикл обучения. Авторы работы (Hongyang He, Jiuming Liu, Victor Sanchez) предлагают преодолеть это ограничение через Semi-supervised Chain-of-Thought Learning (Semi-CoT) — фреймворк, который превращает неразмеченные вопросы в источник псевдо-супервизии.

Механика: Энтропийный гейт

Метод работает по принципу самообучения (self-training), но с жесткой фильтрацией. Для каждого неразмеченного вопроса генерируется несколько вариантов псевдо-CoT. Затем система оценивает семантическую энтропию ответов. Цепочки с низкой энтропией (высокой уверенностью модели) отбираются как надежные примеры для дообучения.

Результаты: Точность и ограничения

Пилотные эксперименты показали, что «энтропийный гейт» действительно отбирает высококачественные данные. Точность псевдо-ответов варьируется от 91,36% до 100%. Однако влияние на финальную точность моделей (student models) оказалось неоднозначным: на некоторых датасетах прирост есть, на других — перенос знаний отрицательный.

Датасет Точность псевдо-ответов Влияние на модель (Transfer)
GSM8K Высокая (в диапазоне 91-100%) Небольшой прирост
SVAMP Высокая (в диапазоне 91-100%) Небольшой прирост
AQuA Высокая (в диапазоне 91-100%) Отрицательный перенос (Negative Transfer)
MultiArith Высокая (в диапазоне 91-100%) Достигнут потолок (Ceiling)

Вывод

Исследование подтверждает, что неразмеченные вопросы могут служить надежным источником псевдорассуждений. Однако для эффективного использования этого сигнала требуются более совершенные методы отбора демонстраций или архитектуры обучения студентов, способные фильтровать шум, присутствующий даже в «высокоэнтропийно-чистых» выборках.

Источник: arXiv cs.AI ↗