Проблема «галлюцинаций» в корпоративной аналитике
В корпоративной среде ошибка LLM при генерации SQL или аналитического кода стоит дорого. Стандартный подход, где нейросеть сама пишет и запускает код, часто приводит к несоответствию результата заявленному запросу. Исследование MasterControl AI Lab (preprint от 2 сентября 2026 года) предлагает радикальное решение: разделение ответственности. Языковая модель выступает лишь как «интерпретатор намерений», а фактический расчет выполняет строго регламентированный, детерминированный аналитический движок.
Архитектура MasterControl: Интерпретатор + Полис
Система работает по принципу «Governed approach» (управляемый подход). Архитектура состоит из двух частей:
- LLM-интерпретатор: Понимает естественный язык пользователя и формирует запрос.
- Детерминированный полис (Policy): Выбирает и запускает только предварительно утвержденные аналитические программы. Эти программы ограничены классом реляционных операций, агрегации, сравнений, оконных функций, ранжирования и вычисления сходства.
Такой подход гарантирует, что результаты всегда воспроизводимы (replayable), так как значения, данные, правила выполнения и политика фиксированы.
Эксперимент: 8B-модели против детерминизма
Авторы провели сравнительное тестирование на трех моделях размером 8 миллиардов параметров. Цель — проверить, могут ли современные LLM самостоятельно сгенерировать полный ответ и доказательную базу (evidence) в рамках заданных ограничений.
| Метрика | 3 LLM (Runtime Planning) | MasterControl Policy (Hybrid) |
|---|---|---|
| Количество запусков | 440 | 110 |
| Успешность (полное соответствие контракту) | 0 из 330 (0%) | 110 из 110 (100%) |
| Роль LLM | Генерация кода + выбор инструментов | Только интерпретация намерения |
| Исполнитель | Самостоятельно | Утвержденный детерминированный движок |
Ключевой вывод: ни один из 330 эпизодов с самостоятельным планированием (runtime-planning) не смог выдать полный ответ и доказательство. В то же время гибридная система MasterControl достигла 100% точности на тестовых наборах данных.
Почему это важно для индустрии
Результаты исследования бьют по тренду на создание полностью автономных AI-агентов для аналитики. Авторы подчеркивают, что это «конфигурационно-специфичный результат», который не отрицает возможности успеха агентов в других дизайнах, но четко показывает уязвимость текущего подхода к автономной генерации кода в строгих условиях.
Для бизнеса это означает переход от «доверия к LLM» к «верифицируемой аналитике». Использование детерминированных полисов позволяет внедрять AI в процессы, где цена ошибки равна нулю, сохраняя при этом гибкость естественного языка для ввода запросов.
Источник: arXiv cs.AI ↗
