Масштаб задачи: от школы до рабочих мест
Автор исследования, djbinder, попытался количественно оценить объем знаний, необходимых для выполнения всех 150 миллионов рабочих мест в США. Расчеты включают два основных этапа: формальное образование и обучение на рабочем месте (on-the-job training).
Суммарное время формального образования (школы, колледжи, аспирантуры, ординатуры) составляет около 7 миллионов часов (или 3 500 полных рабочих лет для одного человека). Однако основной объем знаний приобретается уже после трудоустройства. Опросы BLS и O*NET показывают, что среднему сотруднику требуется от 28 дней до 8 месяцев обучения после найма.
Ключевые метрики обучения
Учет дублирования профессий на одних и тех же предприятиях снижает количество уникальных позиций с 150 млн до ~60 млн. Ниже приведены данные об объеме необходимых знаний:
| Источник данных | Метрика | Среднее время на позицию | Общий объем (для 60 млн позиций) |
|---|---|---|---|
| BLS Occupational Requirements Survey | Минимальное обучение после найма | 28 дней | ~1,68 млрд часов |
| O*NET | Обучение до уровня текущего сотрудника | ~8 месяцев | ~4,8 млрд часов |
С учетом того, что навыки часто пересекаются (например, переход между филиалами одной сети), реальный объем уникального обучения, вероятно, находится в диапазоне от 1,6 до 4,8 миллиардов часов.
Стоимость вычислений: $10–100 млрд
Главный инсайт исследования заключается в сравнении стоимости обучения ИИ с текущими затратами на вычисления. При допущении, что современные системы учатся со скоростью, эквивалентной человеческой (в пересчете на FLOP на секунду обучения), объем необходимых вычислений составляет от 10^24 до 10^25 FLOP.
- Это примерно в 100 раз больше, чем используется в крупнейших современных тренировках LLM.
- При текущих ценах на оборудование это обойдется в $10–100 миллиардов.
- Для контекста: это менее 1% от годовой суммы заработных плат всех работников США.
Проблема данных и непрерывного обучения
Сбор данных для такого объема обучения не является непреодолимым барьером: объем информации сопоставим со всем видео на YouTube или суточным объемом данных со всех камер мира. Основная проблема — неэффективность текущих алгоритмов по сравнению с человеческим мозгом.
Хотя однократное обучение теоретически возможно, реальность требует непрерывного обучения (continual learning), так как профессии меняются. Если ИИ не сможет адаптироваться в реальном времени без полной переобучки, это станет качественным барьером для массового внедрения, несмотря на финансовую доступность первоначального обучения.
Источник: LessWrong ↗
