Вычисления как поиск паттернов
Ключевой вывод 70-летних исследований ИИ: общие методы, использующие вычисления, превосходят узкоспециализированные. В отличие от человеческого интеллекта, который ограничен 8 миллиардами мозгов и проблемами координации, GPU масштабируются предсказуемо. Владеть миллионом видеокарт, которые непрерывно ищут паттерны, — более надежный путь к общему интеллекту, чем найм тысячи гениев.
Открытый мир требует бесконечных ресурсов
Мир «большой, открытый и практически не сводимый к одной формуле». Квантовая механика не объяснит напрямую, как организуется психология потребителей. Для решения широкого спектра задач ИИ должен накапливать знания на всех уровнях абстракции. Конкурент с большим объемом вычислений всегда сможет решить более широкий круг проблем, просто «бросив» больше ресурсов на поиск решений.
Длинный хвост знаний
В отличие от шахматных движков, работающих в замкнутой вселенной с фиксированными правилами, AGI должен решать любые задачи, возникающие в реальном мире. Это требует симуляции мира и хранения огромных объемов знаний, включая междисциплинарные связи (механика + психология + экономика). Размер модели (количество параметров) здесь выступает как экономический аргумент: больше параметров = больше хранимой мудрости.
Эффект многократного прохода по данным
Страх перед «потолком данных» (data wall) необоснован. История науки показывает, что новые инсайты рождаются не только из новых данных, но и из новой организации старых. Больше вычислений на одни и те же данные позволяет извлекать больше паттернов. Явление «гроккинга» (grokking) демонстрирует, что длительное обучение на одних и тех же данных приводит к переходу от запоминания ярлыков к пониманию алгоритмов.
Сравнение подходов к решению задач
| Критерий | Человеческий интеллект (Human-Compute) | ИИ через масштабирование (GPU-Compute) |
|---|---|---|
| Масштабируемость | Ограничена (~8 млрд человек), сложная координация | Высокая, масштабируется производством чипов |
| Интеграция знаний | Сложно объединить разрозненные инсайты | Паттерны проектируются для лучшей интеграции |
| Работа с данными | Требует новых открытий для каждого прорыва | Может извлекать новые инсайты из старых данных через многократное обучение |
Тестовое масштабирование (Test-time scaling)
При столкновении с новой задачей ИИ использует вычисления для поиска правильных представлений и их комбинирования. Это происходит во время тестирования (reasoning), где дополнительные вычислительные ресурсы позволяют модели «подумать» и найти решение, которое не было явно зашито в весах, но выведено из первых принципов.
Источник: LessWrong ↗
