Проблема ручного создания бенчмарков
Создание научных бенчмарков для языковых моделей (LLM) традиционно требует огромных трудозатрат экспертов. Обычно специалисты пишут задачи вручную или адаптируют материалы из учебников, что приводит к высокой стоимости и медленному процессу. Языковые модели могут быстро генерировать кандидаты, но главная проблема — их валидация. Как убедиться, что задача действительно требует сложных вычислений, а не просто знания из обучающей выборки?
Механика ToolGate: три фильтра
Команда авторов (Ke Zhang, Yankang Liu, Roya Zandi, Maziar Raissi) предложила методологию ToolGate, которая рассматривает каждый сгенерированный кандидат как предложение, проходящее через три строгих этапа проверки. Цель — изолировать задачи, зависящие от специализированного программного обеспечения (в данном случае FEniCSx для решения уравнений в частных производных).
Процесс включает:
- Гейт 1 (Исполняемость): Скрипт решения должен точно воспроизвести предложенный ответ при запуске в целевом ПО.
- Гейт 2 (Отсутствие инструмента): Рандомизированная проверка без использования софта. Если модель может ответить только по тексту промпта, задача исключается как тривиальная.
- Гейт 3 (Агент-решатель): Специализированный агент должен решить задачу в рамках лимита времени.
Результаты эксперимента: от 500 к 128
В ходе пилотного исследования было сгенерировано 500 кандидатов. Процесс фильтрации оказался жестким, отсеивая более 75% исходного пула. Ключевым этапом стала повторная проверка после генерации, чтобы исключить утечку данных из обучающих выборок моделей.
| Этап фильтрации | Количество кандидатов | Действие системы |
|---|---|---|
| Начало | 500 | Генерация кандидатов |
| После Гейта 1 (Исполняемость) | 478 | Скрипт воспроизвел ответ |
| После повторной проверки (No-Tool) | 256 | Исключено 222 задачи, решаемые без ПО |
| После проверки API (GPT-5.5) | 135 | Исключено 121 задача, решаемых "на лету" |
| После работы агента (GPT-5.5 Codex) | 130 | Агент успешно решил задачу |
| Финальный пул | 128 | Уникальные задачи (после дедупликации) |
Почему это важно
ToolGate демонстрирует, что автоматизация создания бенчмарков возможна, но требует многоуровневой верификации. Использование GPT-5.5 (как API, так и Codex CLI) в качестве "судьи" позволяет отсеять задачи, которые LLM решают по памяти, а не через рассуждение. Оставшиеся 128 задач представляют собой надежный набор для оценки способности моделей к сложным научным вычислениям с использованием внешних инструментов.
Источник: arXiv cs.AI ↗
