Проблема: надежность — это не только capability
Традиционно считается, что надежность больших языковых моделей (LLM) определяется исключительно их внутренними возможностями (capability). Авторы работы CogniConsole — Ванесса Фигейредо и Вилтер Франчески — оспаривают этот подход. Они доказывают, что ключевым фактором надежности является inference-time control (управление во время вывода) — вычислительный слой, отвечающий за формулировку задачи и выбор контекста.
Решение: CogniConsole как абстракция
Исследователи представили CogniConsole — архитектурный интерфейс, который выносит управление за пределы самой модели. Система комбинирует программную координацию с ограниченным промпт-обоснованием. Это позволяет структурировать взаимодействие с LLM, превращая «черный ящик» в предсказуемый модуль.
Эксперимент: 489 контрольных точек
Для проверки гипотезы была проведена серия из 489 управляющих зондов (probes) в многошаговой интерактивной среде. Целью было измерить влияние уровня структурной поддержки на стабильность ответов модели. Результаты показали систематическое снижение дисперсии выходных данных и частоты сбоев по мере усложнения структуры.
| Уровень структуры | Характеристика | Результат (на одной и той же модели) |
|---|---|---|
| Unstructured | Свободный промпт без ограничений | Высокая дисперсия, частый дрейф контекста |
| Partially Scaffolded | Частичные инструкции и шаблоны | Снижение ошибок, но сохранение нестабильности |
| Fully Scaffolded | Полная структурная поддержка (CogniConsole) | Минимальная дисперсия, строгое соблюдение ограничений |
Почему это важно
Исследование выявило, что многие типичные ошибки LLM, такие как context drift (дрейф контекста) и несоблюдение ограничений, возникают не из-за недостатка интеллекта модели, а из-за плохо определенной архитектуры управления. Работа открывает новое направление: проектирование систем LLM должно сместить фокус с простого масштабирования параметров на разработку формальных абстракций для контроля во время инференса.
Источник: arXiv cs.AI ↗
