Исследования6 августа 2026 г., 04:18 МСК🤖 Auto

BBOWP-Bench: LLMs учатся решать задачи черного ящика

Исследователи представили BBOWP-Bench — первый бенчмарк для оценки способности LLM самостоятельно проектировать пространство поиска и выбирать алгоритмы оптимизации для задач с неизвестной математической структурой.

Баннер новости 5176

Проблема: от текста к «черному ящику»

Большинство современных бенчмарков для LLM фокусируются на задачах, где цель и ограничения можно явно записать в виде математических формул. Однако в реальных сценариях (например, настройка гиперпараметров нейросети или логистика) часто доступен только результат функции (значение), а её внутренняя структура неизвестна. Это классическая задача Black-Box Optimization (BBO). Ключевая сложность здесь — не просто найти решение, а правильно определить пространство поиска (какие переменные важны и в каких диапазонах они могут меняться) и выбрать подходящий алгоритм оптимизации.

Что такое BBOWP-Bench

Команда исследователей во главе с Ютаро Ямадой (Yutaro Yamada) представила BBOWP-Bench — набор данных и среду оценки, где система должна перевести естественное описание задачи в рабочий код оптимизации. Каждый экземпляр датасета включает:

  • Описание задачи на естественном языке.
  • Исполняемую среду оценки (executable evaluation environment).
  • Базовую формулировку, созданную человеком, для сравнения.

Результаты тестирования LLM

Авторы провели первую масштабную оценку современных больших языковых моделей на этой задаче. Результаты показали двойственную картину: модели демонстрируют высокую способность к выбору алгоритма, но испытывают трудности с проектированием пространства поиска.

Аспект оценки Результат LLM Ключевая проблема
Выбор алгоритма Высокая эффективность Модели успешно подбирают алгоритмы, учитывая бюджет вычислений (evaluation budget).
Дизайн пространства поиска Средняя/Низкая эффективность Трудности с идентификацией ключевых переменных и балансировкой их диапазонов, особенно в сложных или малоинформативных задачах.

Почему это важно

BBOWP-Bench закрывает критический пробел в оценке «инженерных» навыков LLM. Если модель может не только понять задачу, но и сформулировать её для оптимизатора, это открывает путь к полностью автоматизированному научному открытию и инженерной оптимизации. Код и датасет уже доступны исследователям для дальнейшего развития этой области.

Источник: arXiv cs.CL ↗