Исследования15 августа 2026 г., 00:17 МСК🤖 Auto

Qwen 3.6-27B: Обучение концептуального судьи за один проход

Исследователи из LessWrong показали, что дообучение Qwen 3.6-27B на экспертных оценках позволяет модели оценивать качество аргументации за один проход, сокращая разрыв с Opus 4.8 на 50%.

Баннер новости 5830

Проблема оценки концептуального мышления

Концептуальное рассуждение (философия, теория принятия решений, безопасность ИИ) часто не имеет однозначного ответа, что делает традиционные бенчмарки бесполезными. Датасет LMCA оценивает способность моделей критиковать аргументы, сверяясь с экспертами-людьми. Однако текущий метод требует множественных запусков (rollouts) для усреднения результатов, что дорого и вносит дисперсию. Это препятствует прямому дообучению (SFT), так как у экспертов есть только оценки, а не цепочки рассуждений (CoT).

Методология: От CoT к «одному проходу»

Авторы предложили оценивать качество критики за один прямой проход (single forward pass). Модель генерирует распределение вероятностей для цифр от 0 до 9, и результат вычисляется как математическое ожидание этого распределения (через softmax). Это устраняет дисперсию выборки и создает четкую цель для обучения. Для дообучения использовалась модель Qwen 3.6-27B с адаптером LoRA (rank-16) и функцией потерь Gaussian soft cross-entropy, которая учитывает неопределенность экспертных оценок.

Результаты: Базовая модель vs. Дообученная

Дообучение значительно улучшило способность модели отличать качественные аргументы от мусора, особенно от сгенерированных другими моделями. Базовая модель склонна переоценивать «мусорные» критики, вероятно, из-за поверхностных признаков стиля (уверенность, беглость). Дообученная модель научилась игнорировать эти артефакты.

Метрика / Модель Base Qwen 3.6-27B Trained Qwen 3.6-27B Opus 4.8 (Baseline)
Forward pass error 0.1082 0.0651
CoT error (N=3) 0.0997 0.0501
% «мусорных» model-written критик с оценкой ≥ 0.9 29% 0%
Сокращение разрыва с Opus 4.8 ~50% 100%

Почему это важно

Результаты показывают, что простая дообучение на экспертных оценках без цепочек рассуждений эффективно развивает способность модели к концептуальному анализу. Улучшение не объясняется просто отказом от использования стилевых маркеров, так как модель сохраняет качество оценки и на перефразированных текстах. Этот подход открывает путь к созданию эффективных reward models для RLHF в сложных, не имеющих верного ответа доменах, где сбор данных «золотого стандарта» (gold reasoning traces) слишком трудоемок.

Источник: LessWrong ↗