Исследования19 августа 2026 г., 21:19 МСК🤖 Auto

Нейросети учатся по принципу «простейшего контура»: новый теоретический прорыв

Исследователи Каарель и Дмитрий Вайнтроб доказали, что байесовское обучение нейросетей обладает «приоритетом контура» (circuit prior), что объясняет, почему даже переобученные модели быстро находят простые решения.

Баннер новости 6099

Суть открытия: Приоритет простоты

В работе, представленной на LessWrong, исследователи Каарель и Дмитрий Вайнтроб (Kaarel & Dmitry Vaintrob) доказали фундаментальное свойство байесовского обучения нейронных сетей. Они установили, что даже произвольно переобученные (arbitrarily overparametrized) нейросети обладают так называемым "circuit prior" (приоритетом контура). Это означает, что априорное распределение в байесовском выводе неявно отдает предпочтение функциям, которые могут быть реализованы простыми логическими схемами (контурами).

Практическое значение: Эффективность обучения

Главный вывод исследования заключается в том, что если целевая функция, которую нужно выучить, реализуется небольшой логической схемой, то нейросети потребуется небольшое количество обучающих данных для достижения высокой точности на тестовой выборке. Это происходит при определенных масштабирующих коэффициентах априорного распределения. Иными словами, байесовский подход автоматически «предпочитает» простые объяснения, что снижает потребность в огромных датасетах для простых задач.

Детали и ограничения

Результат не является универсальной панацеей. Исследователи подчеркивают наличие важных оговорок (caveats), связанных со скалированием prior-распределения. Работа демонстрирует простейшую версию результата, но оставляет открытыми вопросы для более сложных архитектур и сценариев. В конце презентации (слайды 36–37) перечислен ряд открытых проблем в теории обучения нейросетей, требующих дальнейшего изучения.

Обсуждение сообщества: XOR как тест

В комментариях к публикации пользователь johnswentworth проиллюстрировал сложность задачи, задав вопрос о способности сети выучить функцию XOR от 1000 входных битов. Эта функция имеет сложность контура примерно 2k вентилей при глубине 10. Вопрос заключается в том, подразумевает ли теорема, что стек из десятков MLP (многослойных перцептронов) шириной в тысячи нейронов сможет эффективно выучить такую функцию, опираясь на заявленный приоритет контура. Это указывает на то, что граница применимости теоремы к сверхсложным функциям остается предметом активных дискуссий.

Источник: LessWrong ↗