Суть проблемы: один эксперимент не говорит всей правды
Исследование METR Uplift, опубликованное в июле 2025 года, стало ключевым источником данных о влиянии AI-инструментов на продуктивность разработчиков. Главный вывод оригинала шокировал сообщество: использование AI замедляло выполнение задач на 19%. Однако автор переанализа cdt (LessWrong) применил мета-аналитическую модель, чтобы учесть естественную вариативность результатов в разных условиях.
Проблема одиночного RCT (рандомизированного контролируемого испытания) в том, что оно не учитывает «межисследовательскую вариацию». Если бы мы повторили эксперимент с другими моделями, проектами или разработчиками, результат мог бы сильно отличаться. Автор моделирует этот разброс, используя данные из медицины и экономики как референс-классы.
Методология: от медицины к коду
Поскольку прямых аналогов в IT мало, автор использовал базы данных Cochrane (медицинские RCT) и Askarov et al. (экономические исследования) для оценки уровня вариативности. Это позволило построить иерархическую байесовскую модель, которая отделяет шум эксперимента от реального эффекта.
| Источник данных | Тип | Средний лог-эффект (μ) | Стд. отклонение вариации (σ) |
|---|---|---|---|
| Cochrane | Медицина (RCT) | -0.22 | 0.38 |
| Askarov et al. | Экономика | -0.50 | 0.39 |
Ключевые цифры и интервалы
При применении этих priors к данным METR, разброс возможных результатов становится колоссальным. Даже без учета прогресса самих AI-моделей, 95% доверительный интервал охватывает диапазон от замедления на 55% до ускорения на 193%.
- Средний эффект популяции: находится в диапазоне 10-20% (в пользу ускорения), но распределение имеет «тяжелые хвосты».
- Вероятность замедления: оценивается в 66–79% в зависимости от выбранной модели вариативности.
- Интерпретация: Исследование совместимо как с резким ростом производительности, так и с ее падением. Оригинальное значение в -19% находится внутри этого широкого коридора.
Почему это важно сейчас?
С выходом моделей уровня Opus 4.8, Fable и Sol, многие разработчики сообщают об ускорении работы минимум на 50%. Как примирить это с данными METR? Высокая межисследовательская вариация объясняет радикальные расхождения в субъективных ощущениях и отдельных кейсах. Мы не можем просто экстраполировать один эксперимент 2025 года на текущий момент, особенно учитывая, что повторить RCT такого уровня до «точки невозврата» в развитии AI, вероятно, уже не удастся. Данные требуют более сложного статистического моделирования, чем просто сравнение «до» и «после».
Источник: LessWrong ↗
