Проблема: LLM не знают физику вашего завода
Операторы очистных сооружений часто задают каузальные вопросы: «Почему растет N2O?» или «Что будет, если снизить аэрацию на 20%?». Обычные LLM отвечают на основе общих текстов, игнорируя специфику конкретного завода. Авторы статьи предлагают решить это, «привязав» замороженную модель Qwen2.5-32B-Instruct к архитектурно интерпретируемому симулятору сточных вод CCSS-IX.
Методология: три пути интеграции
Ученые сравнили три конкретных способа grounding (привязки) модели к данным симулятора:
- Method 1 (Live Oracle): Прямой доступ к симулятору в реальном времени. Модель использует симулятор как инструмент (tool-use) для получения ответов.
- Method 2 (Structured Injection): Статическая инъекция параметров завода в контекстное окно модели в виде структурированной таблицы.
- Method 3 (DRR Retriever): Использование обучаемого ретривера Decoupled Recall-Reasoning (DRR) объемом 110 млн параметров. Он извлекает релевантные параметры под конкретный вопрос.
Результаты: точность и скорость
На бенчмарке из 198 каузальных вопросов методы показали радикально разные результаты. Метод DRR оказался не только точным, но и универсальным: он обучается под конкретный завод за ~17 секунд и сохраняет эффективность при переносе на другие объекты.
| Метод | Точность (198 вопросов) | Специфика |
|---|---|---|
| Method 1 (Live Oracle) | 99.5% | Высшая точность, но требует постоянного доступа к симулятору |
| Method 2 (Injection) | 79.0% | Статичен, не переносится между заводами |
| Method 3 (DRR Retriever) | 75.8% | Обучается за 17 сек, переносится на другие заводы (88% точности) |
| Baseline (RAG) | 48.0% | Слабейший результат среди протестированных |
Контрфакты и переносимость
На тесте из 60 контрфактических вопросов (сценарии «что если») метод DRR превзошел инъекцию параметров на +16.3 процентных пункта (95% CI [+7.1, +26.4]), показав 100% точность в определении временных масштабов и режимов работы. Ключевое преимущество DRR — способность к cross-plant transfer: после переноса на биологически отличный завод точность упала лишь до 88%, тогда как статическая таблица Method 2 стала бесполезной.
Вывод для индустрии
Исследование доказывает, что гибридный подход (LLM + симулятор) превосходит чистые RAG-системы. Механизм DRR демонстрирует, что узкоспециализированные ретриверы могут эффективно работать не только в очистных, но и в общих задачах (ARC benchmark: 79% против 76% у Llama-3.1-8B), что открывает путь к созданию «завод-портативных» AI-ассистентов.
Источник: arXiv cs.CL ↗
