Исследования29 сентября 2026 г., 06:19 МСК🤖 Auto

Benchy: единый язык для AI-бенчмарков на базе YAML

Исследователи представили Benchy — семантический язык и движок для стандартизации тестирования ИИ, исключающий скрытые настройки и обеспечивающий детерминированное сравнение моделей.

Баннер новости 8476

Проблема фрагментации в AI-тестировании

Современная экосистема искусственного интеллекта страдает от отсутствия единого стандарта в оценке моделей. Разрозненные бенчмарки часто используют разные метрики, скрытые пре- и пост-обработки данных, что делает сравнение результатов между различными архитектурами некорректным. Исследователи Francis F. Daniel, Mauro Ibañez, Francis Perelman и Marian Basti предлагают решение — Benchy, семантический язык и движок исполнения, который формализует процесс создания и запуска тестов.

Архитектура: YAML, JSON и строгая типизация

Суть Benchy заключается в том, что любой бенчмарк полностью специфицируется программой, функцией оценки и набором данных, что записывается в формате B=(P,S,D). Ключевая инновация — использование канонического YAML для авторства, где каждому семантическому понятию соответствует одна валидная синтаксическая конструкция. Это предотвращает двусмысленность.

Программы компилируются в канонический JSON (промежуточное представление), который исполняет движок. Важно отметить: компиляция меняет только представление, но не смысл. Система не исправляет невалидные определения и не внедряет скрытые значения по умолчанию, что гарантирует прозрачность.

Универсальный контракт исполнения

Benchy вводит единый runtime-контракт для интеграции внешних ИИ-систем. Механика интеграции отделена от семантики бенчмарка. Движок требует строгого формата:

  • Input: объект с именованными полями.
  • Output: объект с именованными полями, где листовые узлы являются измеримыми размерами оценки.

Это позволяет внешним ИИ-системам адаптироваться на границе взаимодействия, не влияя на внутреннюю логику теста.

Семантическая модель и онтология

Язык опирается на общую онтологию задач, доменов и языков. Валидация задач на основе программ обеспечивает строгое соответствие между заявленной целью теста и его реализацией. В приложении к статье описан нормативный инженерный контракт для первой реализации движка, что делает Benchy готовым к практическому применению.

Почему это важно

Введение универсального языка для бенчмарков снижает порог входа для валидации новых моделей и устраняет «черные ящики» в оценке производительности. Для индустрии это шаг к воспроизводимости результатов и честному сравнению AI-систем, независимо от их архитектуры.

Источник: arXiv cs.AI ↗