Проблема: Имитация вычислений вместо оптимизации
Существующие пайплайны (NL4Opt, OptiMUS, ORLM, OR-LLM-Agent) преобразуют естественный язык в числовые планы, фиксируя единственную цель и точечные коэффициенты. Это создает хрупкость: если допущения неверны, план рушится. YUKTI меняет парадигму, используя граф типизированных пропозиций, где отношения несут априорные знания, неопределенность коэффициентов и происхождение данных.
Методология: ARPF и Regret Certificate
Ядро системы — Assumption-Robust Pareto Frontiers (ARPF). Алгоритм ресемплирует допущения (включая структурную эпсилон-загрязнение), чтобы оценить, как часто каждое действие выживает (метрика rho). Автор доказал, что rho является точным фактором сожаления (regret) решения. Система также генерирует Regret Certificate — аудиторский след, объясняющий, почему выбрано именно это решение.
Результаты: YUKTI против LLM
В сравнительном тесте LLM, получившая верные числа и задачу одноцелевой оптимизации, показала катастрофически высокий уровень сожаления. YUKTI использует стандартные решатели (exact, nonlinear, evolutionary), но выигрывает за счет архитектуры передачи распределений между этапами.
| Метрика / Сценарий | YUKTI | Наивный точечный план / LLM |
|---|---|---|
| Снижение среднего и хвостового regret (контролируемая ошибка спецификации) | >90% | База сравнения |
| Уровень held-out regret (head-to-head с LLM) | 1x (база) | ~47x (LLM) |
| Backtest на 41,188 реальных решениях (out-of-sample) | +34% к статус-кво | +4% к наивному правилу |
Практическое применение
Система валидирована на трех фронтах: от контролируемых симуляций до реальных коммерческих решений в регулируемой среде, где оптимизация происходит внутри законного пространства действий с оценкой рисков в евро. На публичном датасете из 41 188 записей YUKTI не только превзошел текущий статус-кво, но и снизил эффект «проклятия оптимизатора» (optimizer's curse).
Вывод: LLM — формулятор, не решатель
Авторы подчеркивают: LLM хороши как формулировщики задач, но плохи как решатели. При долгосрочной причинно-следственной связи прямой передачей решений становится ненадежной, и система требует перехода к политике обратной индукции. YUKTI не претендует на SOTA в бенчмарках, но предлагает надежный механизм верификации для критически важных решений.
Источник: arXiv cs.AI ↗
