Исследования3 сентября 2026 г., 13:19 МСК🤖 Auto

ToolGate: Как AI-агенты создают научные бенчмарки с помощью FEniCSx

Исследователи представили ToolGate — конвейер для автоматической валидации научных задач, требующих вычислений. Система отфильтровала 500 попыток, оставив 128 уникальных задач, которые не могут быть решены без специализированного ПО.

Баннер новости 6673

Проблема ручного создания бенчмарков

Создание научных бенчмарков для языковых моделей (LLM) традиционно требует огромных трудозатрат экспертов. Обычно специалисты пишут задачи вручную или адаптируют материалы из учебников, что приводит к высокой стоимости и медленному процессу. Языковые модели могут быстро генерировать кандидаты, но главная проблема — их валидация. Как убедиться, что задача действительно требует сложных вычислений, а не просто знания из обучающей выборки?

Механика ToolGate: три фильтра

Команда авторов (Ke Zhang, Yankang Liu, Roya Zandi, Maziar Raissi) предложила методологию ToolGate, которая рассматривает каждый сгенерированный кандидат как предложение, проходящее через три строгих этапа проверки. Цель — изолировать задачи, зависящие от специализированного программного обеспечения (в данном случае FEniCSx для решения уравнений в частных производных).

Процесс включает:

  • Гейт 1 (Исполняемость): Скрипт решения должен точно воспроизвести предложенный ответ при запуске в целевом ПО.
  • Гейт 2 (Отсутствие инструмента): Рандомизированная проверка без использования софта. Если модель может ответить только по тексту промпта, задача исключается как тривиальная.
  • Гейт 3 (Агент-решатель): Специализированный агент должен решить задачу в рамках лимита времени.

Результаты эксперимента: от 500 к 128

В ходе пилотного исследования было сгенерировано 500 кандидатов. Процесс фильтрации оказался жестким, отсеивая более 75% исходного пула. Ключевым этапом стала повторная проверка после генерации, чтобы исключить утечку данных из обучающих выборок моделей.

Этап фильтрации Количество кандидатов Действие системы
Начало 500 Генерация кандидатов
После Гейта 1 (Исполняемость) 478 Скрипт воспроизвел ответ
После повторной проверки (No-Tool) 256 Исключено 222 задачи, решаемые без ПО
После проверки API (GPT-5.5) 135 Исключено 121 задача, решаемых "на лету"
После работы агента (GPT-5.5 Codex) 130 Агент успешно решил задачу
Финальный пул 128 Уникальные задачи (после дедупликации)

Почему это важно

ToolGate демонстрирует, что автоматизация создания бенчмарков возможна, но требует многоуровневой верификации. Использование GPT-5.5 (как API, так и Codex CLI) в качестве "судьи" позволяет отсеять задачи, которые LLM решают по памяти, а не через рассуждение. Оставшиеся 128 задач представляют собой надежный набор для оценки способности моделей к сложным научным вычислениям с использованием внешних инструментов.

Источник: arXiv cs.AI ↗