Исследования7 августа 2026 г., 10:18 МСК🤖 Auto

Малые модели копируют людей: 1B параметров против 70B

Исследование показывает, что LLM от 0.6B до 1B параметра способны имитировать поведение человека так же точно, как гигантские 70B-модели, если обучены на данных Psych-101.

Баннер новости 5283

Миф о масштабе: малые модели работают не хуже больших

Команда исследователей Nick Oh и Fernand Gobet провела масштабный эксперимент, обучив 14 моделей различных архитектур (от 135M до 14B параметров) на датасете Psych-101. Этот датасет содержит 10.7 миллионов решений, принятых участниками 160 психологических экспериментов. Главная цель — понять, действительно ли большие языковые модели (LLM) понимают структуру задачи, или просто используют статистические уловки.

Результаты оказались неожиданными: в пределах распределения данных (in-distribution) масштаб почти не имеет значения. Модели упираются в «потолок» точности, и модели объемом 0.6B–1B параметров успешно сопоставляют результаты с базовой линией в 70B параметров на отложенных участниках.

Обобщение: где большие модели все же выигрывают

Ситуация меняется при выходе за пределы обучающей выборки (out-of-distribution). Здесь наблюдается более крутая кривая масштабирования: большие модели демонстрируют явное преимущество в обобщении на новые, невиданные ранее структуры задач. Это указывает на то, что хотя малые модели могут копировать паттерны, большие лучше справляются с переносом знаний.

Диагностика: что именно «знает» модель?

Чтобы исключить возможность того, что модели просто запоминают историю выборов, исследователи провели два стресс-теста:

  • Маскирование каналов: Поочередное удаление инструкций, стимулов, обратной связи и истории выборов. Оказалось, что маскировка стимулов и обратной связи уничтожает 75.7% обученной информации, опуская точность ниже случайного уровня. Это доказывает, что история выборов сама по себе не объясняет успех моделей.
  • Перестановка порядка: Модели инвариантны к порядку в задачах с независимыми испытаниями, но чувствительны к нему, если текущий ответ зависит от предыдущего.

Практическое применение: шумовые потолки

Авторы заключают, что небольшие когнитивно-дообученные модели (small cognitively fine-tuned models) перспективны как оценщики шумовых потолков (noise ceiling estimators) для психологических экспериментов. Они позволяют быстро оценивать сложность задач, хотя их возможности ограничены парадигмами, присутствующими в обучающих данных.

Параметры модели Результат (In-distribution) Результат (Out-of-distribution) Ключевой вывод
0.6B – 1B Сопоставимо с 70B Уступает большим моделям Достаточно для имитации поведения в знакомых задачах
> 7B (до 14B) На «потолке» точности Явное преимущество Лучше обобщают новые структуры задач
70B (Baseline) Референс Референс Не является обязательным для базовой имитации

Источник: arXiv cs.AI ↗