Проблема: Дороговизна самоулучшения
Кодовые агенты способны рекурсивно изменять свой собственный код, создавая цикл самообучения. Однако существующие подходы требуют огромных вычислительных ресурсов. Главная проблема — оценка кандидатов на модификацию: традиционные методы заставляют агент заново запускать подмножество тестовых задач с измененным кодом, что занимает много времени и денег.
Решение: SIFT (Self Improvement via Fast Tree-search)
Авторы (Xinghong Fu, Aravinth Kulanthaivelu, Yutaro Yamada) предлагают фреймворк SIFT, который разделяет процесс поиска. Вместо того чтобы сразу запускать тяжелые тесты, система использует LLM-as-a-judge для парного сравнения предложенных патчей (изменений кода). Результаты сравнений агрегируются с помощью регуляризованной модели Брэдли-Терри, что позволяет присвоить каждому кандидату «сильный» балл.
Эти баллы используются для рангового выбора родителей в легковесном дереве поиска. Тяжелые downstream-тесты (проверка на реальных задачах) запускаются только для самых перспективных узлов дерева, что резко снижает нагрузку.
Результаты на Polyglot Benchmark
Метод SIFT демонстрирует превосходство над существующими подходами на базе дерева поиска. Ключевое преимущество — значительное снижение потребления ресурсов при сохранении или улучшении качества кода.
| Метрика | Преимущество SIFT |
|---|---|
| Вычислительные ресурсы | Значительно меньше CPU-часов |
| Время выполнения | Сокращено wall clock time |
| Стоимость | Ниже API-затраты |
| Качество кода | Превосходство на Polyglot benchmark |
Почему это важно
SIFT решает фундаментальную проблему масштабируемости автономных AI-агентов. Делая процесс самооптимизации доступным по стоимости, метод открывает путь к созданию более сложных и независимых систем, которые могут постоянно улучшать свой код без необходимости в суперкомпьютерах.
Источник: arXiv cs.AI ↗
