Миф о масштабе: малые модели работают не хуже больших
Команда исследователей Nick Oh и Fernand Gobet провела масштабный эксперимент, обучив 14 моделей различных архитектур (от 135M до 14B параметров) на датасете Psych-101. Этот датасет содержит 10.7 миллионов решений, принятых участниками 160 психологических экспериментов. Главная цель — понять, действительно ли большие языковые модели (LLM) понимают структуру задачи, или просто используют статистические уловки.
Результаты оказались неожиданными: в пределах распределения данных (in-distribution) масштаб почти не имеет значения. Модели упираются в «потолок» точности, и модели объемом 0.6B–1B параметров успешно сопоставляют результаты с базовой линией в 70B параметров на отложенных участниках.
Обобщение: где большие модели все же выигрывают
Ситуация меняется при выходе за пределы обучающей выборки (out-of-distribution). Здесь наблюдается более крутая кривая масштабирования: большие модели демонстрируют явное преимущество в обобщении на новые, невиданные ранее структуры задач. Это указывает на то, что хотя малые модели могут копировать паттерны, большие лучше справляются с переносом знаний.
Диагностика: что именно «знает» модель?
Чтобы исключить возможность того, что модели просто запоминают историю выборов, исследователи провели два стресс-теста:
- Маскирование каналов: Поочередное удаление инструкций, стимулов, обратной связи и истории выборов. Оказалось, что маскировка стимулов и обратной связи уничтожает 75.7% обученной информации, опуская точность ниже случайного уровня. Это доказывает, что история выборов сама по себе не объясняет успех моделей.
- Перестановка порядка: Модели инвариантны к порядку в задачах с независимыми испытаниями, но чувствительны к нему, если текущий ответ зависит от предыдущего.
Практическое применение: шумовые потолки
Авторы заключают, что небольшие когнитивно-дообученные модели (small cognitively fine-tuned models) перспективны как оценщики шумовых потолков (noise ceiling estimators) для психологических экспериментов. Они позволяют быстро оценивать сложность задач, хотя их возможности ограничены парадигмами, присутствующими в обучающих данных.
| Параметры модели | Результат (In-distribution) | Результат (Out-of-distribution) | Ключевой вывод |
|---|---|---|---|
| 0.6B – 1B | Сопоставимо с 70B | Уступает большим моделям | Достаточно для имитации поведения в знакомых задачах |
| > 7B (до 14B) | На «потолке» точности | Явное преимущество | Лучше обобщают новые структуры задач |
| 70B (Baseline) | Референс | Референс | Не является обязательным для базовой имитации |
Источник: arXiv cs.AI ↗
