Стандартный пайплайн машинного обучения, знакомый каждому специалисту, предполагает разделение данных на обучающую, валидационную и тестовую выборки. Ключевое правило здесь: тестовые данные должны происходить из того же распределения, что и обучающие. Это гарантирует, что модель не переобучилась на конкретные примеры. Однако для задач, требующих генерализации (обобщения), этот подход становится критическим недостатком.
Проблема «ложной компетентности»
Если задача формулируется как «описать выполнение программы по её коду», а модель обучается только на Python, она может отлично справляться с тестом на Python, но полностью провалиться на Java. Традиционный тест не выявит этого, так как распределение данных совпадает. Armstrong предлагает использовать Out-of-Distribution (OOD) тесты: если обучение велось на Python и C++, то тест должен состоять из Java или Lisp. Успех в таком сценарии — единственное доказательство того, что модель поняла суть задачи, а не просто запомнила синтаксис конкретного языка.
Новый тип переобучения
Автор выделяет два вида переобучения:
- Традиционное: модель запоминает конкретные примеры из обучающей выборки.
- Распределительное: модель адаптируется под специфические условия сбора данных (например, стиль кода, домен или источник), не понимая общей логики задачи.
Использование резко отличающихся тестовых наборов защищает именно от второго типа. Однако есть важное ограничение: такие тесты являются одноразовыми. Если использовать их для тонкой настройки гиперпараметров, они превращаются в валидационные, и модель снова переобучается на новое распределение. Рекомендуется иметь резерв из нескольких уникальных OOD-наборов.
Реальные примеры и бенчмарки
Идея не нова, но становится всё более актуальной. В таблице ниже приведены ключевые проекты, внедряющие оценку на OOD-данных:
| Проект | Год | Суть подхода |
|---|---|---|
| SCAN | 2018 | Модели, успешные на случайных сплитах композиционного языка, проваливались на сплитах, изменённых по структуре (новые глаголы, длинные последовательности). |
| 2020 | Формализация подхода «leave-one-domain-out». Показывает, что выбор модели становится нетривиальным, когда тестовое распределение отличается от обучающего. | |
| WILDS | 2021 | Бенчмарк реальных задач (опухли в разных больницах, дикая природа с разных камер), предоставляющий официальные OOD-сплиты для оценки истинной компетенции. |
Переход к оценке на OOD-данных — это не просто техническая деталь, а смена парадигмы. Мы должны перестать спрашивать у моделей: «Насколько хорошо вы запомнили эти данные?», и начинать спрашивать: «Насколько хорошо вы понимаете задачу в новых, незнакомых условиях?».
Источник: LessWrong ↗
