Суть эксперимента: конфликт конвенций
Автор исследует поведение модели, обученной на одном и том же корпусе задач, но записанных в двух несовместимых, но верных конвенциях. Ключевой вопрос: как порядок подачи этих данных записывается в параметры модели? Оказывается, расписание скорости обучения (learning-rate schedule) выступает не просто фоном, а оператором усреднения, который определяет итоговый результат.
Исследование выделяет два независимых фактора: аранжировка (порядок данных) и расписание (веса шагов). Доказано, что затухающее расписание (cosine decay) сглаживает эффекты порядка, тогда как постоянное расписание позволяет модели зафиксировать «неконтрактированный остаток» на последнем шаге, усиливая влияние порядка.
Количественные результаты: 12.29σ разницы
Эксперимент проводился на 10 различных порядках одного корпуса при фиксированном бюджете вычислений. Запуски повторялись для семейств моделей с разными типами lr_scheduler_type. Результаты показали радикальную разницу в распределении «доверия» модели к конвенциям:
| Параметр | Постоянное расписание (Constant) | Косинусное расписание (Cosine) |
|---|---|---|
| Разброс в распределении (Allocation) | 0.2221 (широкий) | Сильно суженный |
| Контрастные полы (Contrast floors) | 11.63 (монотонно) | Информация недостаточна |
| Состояния моделей (12 arms) | Много различимых состояний | Всего 2 различимых состояния |
| Статистическая значимость эффекта | 12.29σ (сдвиг конвенции) | |
Парадокс «нулевого» эффекта в бенчмарках
Самый важный вывод статьи: хотя порядок данных вызывает колоссальный сдвиг в параметрах (12.29σ), стандартные метрики точности (exact-match) этого не фиксируют. Сумма точностей по обеим конвенциям (acc_A + acc_B) остается постоянной с погрешностью всего 9.7% при изменении доли распределения от 0.04 до 0.87.
Это означает, что модель не теряет и не приобретает общую способность решать задачи. Она лишь «привязывается» (commitment) к одной из конвенций написания. Обычный бенчмарк, не учитывающий форму подачи данных, видит модель как стабильную, хотя её внутреннее представление мира радикально изменилось.
Как «обмануть» привязанность
Авторы предлагают решение: маркировка конвенции в промпте (prompt) полностью устраняет эффект сдвига. В этом случае модель достигает 87.5% от теоретического максимума объединения знаний. Это доказывает, что проблема не в архитектуре или данных, а в том, как оптимизатор усредняет градиенты при разных расписаниях обучения.
Источник: arXiv cs.AI ↗
