Исследования6 сентября 2026 г., 02:18 МСК🤖 Auto

METR Uplift: Почему AI замедляет разработку (и почему это не точно)

Переанализ данных METR RCT показал, что наблюдаемое замедление на 19% может быть статистической погрешностью. Реальный эффект варьируется от -55% до +193% с вероятностью замедления 66-79%.

Баннер новости 6874

Суть проблемы: один эксперимент не говорит всей правды

Исследование METR Uplift, опубликованное в июле 2025 года, стало ключевым источником данных о влиянии AI-инструментов на продуктивность разработчиков. Главный вывод оригинала шокировал сообщество: использование AI замедляло выполнение задач на 19%. Однако автор переанализа cdt (LessWrong) применил мета-аналитическую модель, чтобы учесть естественную вариативность результатов в разных условиях.

Проблема одиночного RCT (рандомизированного контролируемого испытания) в том, что оно не учитывает «межисследовательскую вариацию». Если бы мы повторили эксперимент с другими моделями, проектами или разработчиками, результат мог бы сильно отличаться. Автор моделирует этот разброс, используя данные из медицины и экономики как референс-классы.

Методология: от медицины к коду

Поскольку прямых аналогов в IT мало, автор использовал базы данных Cochrane (медицинские RCT) и Askarov et al. (экономические исследования) для оценки уровня вариативности. Это позволило построить иерархическую байесовскую модель, которая отделяет шум эксперимента от реального эффекта.

Источник данных Тип Средний лог-эффект (μ) Стд. отклонение вариации (σ)
Cochrane Медицина (RCT) -0.22 0.38
Askarov et al. Экономика -0.50 0.39

Ключевые цифры и интервалы

При применении этих priors к данным METR, разброс возможных результатов становится колоссальным. Даже без учета прогресса самих AI-моделей, 95% доверительный интервал охватывает диапазон от замедления на 55% до ускорения на 193%.

  • Средний эффект популяции: находится в диапазоне 10-20% (в пользу ускорения), но распределение имеет «тяжелые хвосты».
  • Вероятность замедления: оценивается в 66–79% в зависимости от выбранной модели вариативности.
  • Интерпретация: Исследование совместимо как с резким ростом производительности, так и с ее падением. Оригинальное значение в -19% находится внутри этого широкого коридора.

Почему это важно сейчас?

С выходом моделей уровня Opus 4.8, Fable и Sol, многие разработчики сообщают об ускорении работы минимум на 50%. Как примирить это с данными METR? Высокая межисследовательская вариация объясняет радикальные расхождения в субъективных ощущениях и отдельных кейсах. Мы не можем просто экстраполировать один эксперимент 2025 года на текущий момент, особенно учитывая, что повторить RCT такого уровня до «точки невозврата» в развитии AI, вероятно, уже не удастся. Данные требуют более сложного статистического моделирования, чем просто сравнение «до» и «после».

Источник: LessWrong ↗