Исследователи Stanford CRFM опубликовали масштабный обзор современных AI-агентов для программирования. Анализ 50+ систем показал, что лучшие агенты на базе Claude 4 Opus достигают 72% на SWE-bench Verified. Это сигнализирует о достижении порога практической применимости автономных агентов.
Исследования25 мая 2026 г., 17:00 МСК
Stanford: AI-агенты решают 40% задач SWE-bench без участия человека
Учёные Стэнфорда опубликовали обзор 50+ AI-агентов. Лучшие системы на Claude 4 решают 40% реальных GitHub Issues полностью автономно.