Проблема оценки концептуального мышления
Концептуальное рассуждение (философия, теория принятия решений, безопасность ИИ) часто не имеет однозначного ответа, что делает традиционные бенчмарки бесполезными. Датасет LMCA оценивает способность моделей критиковать аргументы, сверяясь с экспертами-людьми. Однако текущий метод требует множественных запусков (rollouts) для усреднения результатов, что дорого и вносит дисперсию. Это препятствует прямому дообучению (SFT), так как у экспертов есть только оценки, а не цепочки рассуждений (CoT).
Методология: От CoT к «одному проходу»
Авторы предложили оценивать качество критики за один прямой проход (single forward pass). Модель генерирует распределение вероятностей для цифр от 0 до 9, и результат вычисляется как математическое ожидание этого распределения (через softmax). Это устраняет дисперсию выборки и создает четкую цель для обучения. Для дообучения использовалась модель Qwen 3.6-27B с адаптером LoRA (rank-16) и функцией потерь Gaussian soft cross-entropy, которая учитывает неопределенность экспертных оценок.
Результаты: Базовая модель vs. Дообученная
Дообучение значительно улучшило способность модели отличать качественные аргументы от мусора, особенно от сгенерированных другими моделями. Базовая модель склонна переоценивать «мусорные» критики, вероятно, из-за поверхностных признаков стиля (уверенность, беглость). Дообученная модель научилась игнорировать эти артефакты.
| Метрика / Модель | Base Qwen 3.6-27B | Trained Qwen 3.6-27B | Opus 4.8 (Baseline) |
|---|---|---|---|
| Forward pass error | 0.1082 | — | 0.0651 |
| CoT error (N=3) | 0.0997 | — | 0.0501 |
| % «мусорных» model-written критик с оценкой ≥ 0.9 | 29% | 0% | — |
| Сокращение разрыва с Opus 4.8 | — | ~50% | 100% |
Почему это важно
Результаты показывают, что простая дообучение на экспертных оценках без цепочек рассуждений эффективно развивает способность модели к концептуальному анализу. Улучшение не объясняется просто отказом от использования стилевых маркеров, так как модель сохраняет качество оценки и на перефразированных текстах. Этот подход открывает путь к созданию эффективных reward models для RLHF в сложных, не имеющих верного ответа доменах, где сбор данных «золотого стандарта» (gold reasoning traces) слишком трудоемок.
Источник: LessWrong ↗
