Парадигма Non-Parametric Expert Iteration
Авторы представляют AutoFyn, архитектуру, которая отказывается от классического дообучения (fine-tuning) в пользу непараметрической итерации эксперта. Ключевая инновация заключается в том, что веса базовой модели остаются замороженными. Вместо этого система обновляет постоянное состояние (persistent state) — файлы памяти, отчеты и состояние репозитория — на основе верифицированных сигналов вознаграждения.
Каждый раунд начинается с чистой сессии модели. Оркестратор генерирует альтернативные подходы с помощью специализированных агентов, а верификатор, привязанный к задаче, оценивает работу. Успешные стратегии «запекаются» в память, формируя эффективную политику для следующего раунда без изменения параметров самой нейросети.
Результаты на олимпиадной математике (IMO 2026)
В докладе утверждается, что AutoFyn демонстрирует значительный прирост точности на сложных логических задачах. На шести свежих задачах Международной математической олимпиады (IMO) 2026 года все протестированные модели, имевшие потенциал к улучшению, показали более высокие результаты под управлением AutoFyn по сравнению с их собственными встроенными кодовыми агентами.
Победа в Spider 2.0 и находки в кибербезопасности
Практическая применимость системы подтверждена в двух ключевых доменах:
- Data Science: AutoFyn построил агента с наивысшим рейтингом на бенчмарке Spider 2.0 dbt, что свидетельствует о высокой эффективности в генерации SQL-запросов и работе с базами данных.
- Cybersecurity: Система произвела 16 подтвержденных администраторами уязвимостей (vulnerability advisories) в популярных проектах, включая MetaMask, pnpm, Warp, LiteLLM, Langflow и Open WebUI. Это доказывает способность агента к долгосрочному исследованию кодовой базы и поиску реальных уязвимостей.
Технические детали и архитектура
Система использует явные интерфейсы для передачи знаний между раундами. Это включает в себя:
- Файлы постоянной памяти (persistent memory files).
- Структурированные отчеты о проделанной работе.
- Состояние репозитория (repository state).
Такой подход позволяет избежать «раздувания» модели и переобучения, сохраняя вычислительную эффективность при решении задач с длинным горизонтом планирования (long-horizon agents).
Источник: arXiv cs.AI ↗
