Исследования10 сентября 2026 г., 08:17 МСК🤖 Auto

AutoFyn: ИИ-агент, решающий задачи IMO и находящий уязвимости без дообучения

Команда Adib Hasan представила AutoFyn — систему для длинных цепочек рассуждений, которая улучшает результаты моделей за счет обновления памяти, а не весов. AutoFyn победил в Spider 2.0 и нашел реальные баги в MetaMask и pnpm.

Баннер новости 7144

Парадигма Non-Parametric Expert Iteration

Авторы представляют AutoFyn, архитектуру, которая отказывается от классического дообучения (fine-tuning) в пользу непараметрической итерации эксперта. Ключевая инновация заключается в том, что веса базовой модели остаются замороженными. Вместо этого система обновляет постоянное состояние (persistent state) — файлы памяти, отчеты и состояние репозитория — на основе верифицированных сигналов вознаграждения.

Каждый раунд начинается с чистой сессии модели. Оркестратор генерирует альтернативные подходы с помощью специализированных агентов, а верификатор, привязанный к задаче, оценивает работу. Успешные стратегии «запекаются» в память, формируя эффективную политику для следующего раунда без изменения параметров самой нейросети.

Результаты на олимпиадной математике (IMO 2026)

В докладе утверждается, что AutoFyn демонстрирует значительный прирост точности на сложных логических задачах. На шести свежих задачах Международной математической олимпиады (IMO) 2026 года все протестированные модели, имевшие потенциал к улучшению, показали более высокие результаты под управлением AutoFyn по сравнению с их собственными встроенными кодовыми агентами.

Победа в Spider 2.0 и находки в кибербезопасности

Практическая применимость системы подтверждена в двух ключевых доменах:

  • Data Science: AutoFyn построил агента с наивысшим рейтингом на бенчмарке Spider 2.0 dbt, что свидетельствует о высокой эффективности в генерации SQL-запросов и работе с базами данных.
  • Cybersecurity: Система произвела 16 подтвержденных администраторами уязвимостей (vulnerability advisories) в популярных проектах, включая MetaMask, pnpm, Warp, LiteLLM, Langflow и Open WebUI. Это доказывает способность агента к долгосрочному исследованию кодовой базы и поиску реальных уязвимостей.

Технические детали и архитектура

Система использует явные интерфейсы для передачи знаний между раундами. Это включает в себя:

  • Файлы постоянной памяти (persistent memory files).
  • Структурированные отчеты о проделанной работе.
  • Состояние репозитория (repository state).

Такой подход позволяет избежать «раздувания» модели и переобучения, сохраняя вычислительную эффективность при решении задач с длинным горизонтом планирования (long-horizon agents).

Источник: arXiv cs.AI ↗