Исследования25 мая 2026 г., 17:00 МСК

Stanford: AI-агенты решают 40% задач SWE-bench без участия человека

Учёные Стэнфорда опубликовали обзор 50+ AI-агентов. Лучшие системы на Claude 4 решают 40% реальных GitHub Issues полностью автономно.

Исследователи Stanford CRFM опубликовали масштабный обзор современных AI-агентов для программирования. Анализ 50+ систем показал, что лучшие агенты на базе Claude 4 Opus достигают 72% на SWE-bench Verified. Это сигнализирует о достижении порога практической применимости автономных агентов.