Исследования7 августа 2026 г., 19:18 МСК🤖 Auto

LLM для очистных: Qwen2.5-32B против симулятора сточных вод

Исследователи протестировали три метода привязки LLM к промышленному симулятору: прямой доступ, инъекцию параметров и DRR-ретривер. Лучший метод достиг 99.5% точности на каузальных вопросах.

Баннер новости 5321

Проблема: LLM не знают физику вашего завода

Операторы очистных сооружений часто задают каузальные вопросы: «Почему растет N2O?» или «Что будет, если снизить аэрацию на 20%?». Обычные LLM отвечают на основе общих текстов, игнорируя специфику конкретного завода. Авторы статьи предлагают решить это, «привязав» замороженную модель Qwen2.5-32B-Instruct к архитектурно интерпретируемому симулятору сточных вод CCSS-IX.

Методология: три пути интеграции

Ученые сравнили три конкретных способа grounding (привязки) модели к данным симулятора:

  • Method 1 (Live Oracle): Прямой доступ к симулятору в реальном времени. Модель использует симулятор как инструмент (tool-use) для получения ответов.
  • Method 2 (Structured Injection): Статическая инъекция параметров завода в контекстное окно модели в виде структурированной таблицы.
  • Method 3 (DRR Retriever): Использование обучаемого ретривера Decoupled Recall-Reasoning (DRR) объемом 110 млн параметров. Он извлекает релевантные параметры под конкретный вопрос.

Результаты: точность и скорость

На бенчмарке из 198 каузальных вопросов методы показали радикально разные результаты. Метод DRR оказался не только точным, но и универсальным: он обучается под конкретный завод за ~17 секунд и сохраняет эффективность при переносе на другие объекты.

Метод Точность (198 вопросов) Специфика
Method 1 (Live Oracle) 99.5% Высшая точность, но требует постоянного доступа к симулятору
Method 2 (Injection) 79.0% Статичен, не переносится между заводами
Method 3 (DRR Retriever) 75.8% Обучается за 17 сек, переносится на другие заводы (88% точности)
Baseline (RAG) 48.0% Слабейший результат среди протестированных

Контрфакты и переносимость

На тесте из 60 контрфактических вопросов (сценарии «что если») метод DRR превзошел инъекцию параметров на +16.3 процентных пункта (95% CI [+7.1, +26.4]), показав 100% точность в определении временных масштабов и режимов работы. Ключевое преимущество DRR — способность к cross-plant transfer: после переноса на биологически отличный завод точность упала лишь до 88%, тогда как статическая таблица Method 2 стала бесполезной.

Вывод для индустрии

Исследование доказывает, что гибридный подход (LLM + симулятор) превосходит чистые RAG-системы. Механизм DRR демонстрирует, что узкоспециализированные ретриверы могут эффективно работать не только в очистных, но и в общих задачах (ARC benchmark: 79% против 76% у Llama-3.1-8B), что открывает путь к созданию «завод-портативных» AI-ассистентов.

Источник: arXiv cs.CL ↗