Исследования2 октября 2026 г., 11:17 МСК🤖 Auto

Порядок данных решает: 12.29σ эффект, который исчезает в метриках

Исследование Вэньхуи Чэна доказывает, что порядок данных и расписание обучения (lr_scheduler) формируют «конвенцию» модели, а не её способность. Стандартные бенчмарки не видят этого сдвига, так как суммарная точность остается неизменной.

Баннер новости 8765

Суть эксперимента: конфликт конвенций

Автор исследует поведение модели, обученной на одном и том же корпусе задач, но записанных в двух несовместимых, но верных конвенциях. Ключевой вопрос: как порядок подачи этих данных записывается в параметры модели? Оказывается, расписание скорости обучения (learning-rate schedule) выступает не просто фоном, а оператором усреднения, который определяет итоговый результат.

Исследование выделяет два независимых фактора: аранжировка (порядок данных) и расписание (веса шагов). Доказано, что затухающее расписание (cosine decay) сглаживает эффекты порядка, тогда как постоянное расписание позволяет модели зафиксировать «неконтрактированный остаток» на последнем шаге, усиливая влияние порядка.

Количественные результаты: 12.29σ разницы

Эксперимент проводился на 10 различных порядках одного корпуса при фиксированном бюджете вычислений. Запуски повторялись для семейств моделей с разными типами lr_scheduler_type. Результаты показали радикальную разницу в распределении «доверия» модели к конвенциям:

Параметр Постоянное расписание (Constant) Косинусное расписание (Cosine)
Разброс в распределении (Allocation) 0.2221 (широкий) Сильно суженный
Контрастные полы (Contrast floors) 11.63 (монотонно) Информация недостаточна
Состояния моделей (12 arms) Много различимых состояний Всего 2 различимых состояния
Статистическая значимость эффекта 12.29σ (сдвиг конвенции)

Парадокс «нулевого» эффекта в бенчмарках

Самый важный вывод статьи: хотя порядок данных вызывает колоссальный сдвиг в параметрах (12.29σ), стандартные метрики точности (exact-match) этого не фиксируют. Сумма точностей по обеим конвенциям (acc_A + acc_B) остается постоянной с погрешностью всего 9.7% при изменении доли распределения от 0.04 до 0.87.

Это означает, что модель не теряет и не приобретает общую способность решать задачи. Она лишь «привязывается» (commitment) к одной из конвенций написания. Обычный бенчмарк, не учитывающий форму подачи данных, видит модель как стабильную, хотя её внутреннее представление мира радикально изменилось.

Как «обмануть» привязанность

Авторы предлагают решение: маркировка конвенции в промпте (prompt) полностью устраняет эффект сдвига. В этом случае модель достигает 87.5% от теоретического максимума объединения знаний. Это доказывает, что проблема не в архитектуре или данных, а в том, как оптимизатор усредняет градиенты при разных расписаниях обучения.

Источник: arXiv cs.AI ↗