Проблема: агенты не падают в вакууме
Традиционные бенчмарки оценивают поведение модели, игнорируя «подводные камни» окружения. Исследование Fouad Bousetouane (arXiv:2607.14275) вводит понятие Context Engineering как независимый индикатор надежности. Агенты галлюцинируют, игнорируют инструкции или становятся уязвимыми к инъекциям не из-за слабости LLM, а из-за деградации контекста: инструкций, инструментов, памяти и защитных правил.
Решение: ProofAgent-Harness
Автор разработал инфраструктуру ProofAgent-Harness с многоприсяжным консенсусным оцениванием. Ключевая особенность — изоляция оценки контекста от поведенческих метрик. Это позволяет проводить «префлайт» проверку: если контекст слаб, агент не должен запускаться, даже если базовая модель мощная.
7 критериев оценки контекста
Система измеряет качество контекста по семи параметрам. Ниже приведена корреляция между качеством конкретного аспекта контекста и предсказуемым поведением агента:
| Критерий контекста | Что оценивается | Предсказуемый результат (Behavioral Outcome) |
|---|---|---|
| Grounding Sufficiency (Достаточность заземления) | Наличие и качество фактологической базы | Устойчивость к галлюцинациям |
| Guardrail Coverage (Покрытие стражей) | Наличие защитных правил и ограничений | Устойчивость к манипуляциям (jailbreak) |
| Instruction Consistency (Согласованность инструкций) | Логичность и отсутствие противоречий в промптах | Соблюдение инструкций (Instruction Following) |
| Tool Schema Quality (Качество схем инструментов) | Точность описания API и параметров | Корректность использования инструментов |
| Role Clarity (Ясность роли) | Четкость определения личности агента | Стабильность поведения |
| Injection Hardening (Защита от инъекций) | Изоляция от недоверенных входных данных | Безопасность данных |
| Token Efficiency (Эффективность токенов) | Оптимизация объема контекста | Экономия ресурсов и скорость |
Почему это важно для индустрии
Исследование переносит фокус с бесконечного тюнинга весов модели на аудируемую архитектуру контекста. Для разработчиков это означает возможность внедрения автоматических фильтров: если ProofAgent-Harness выдает низкий балл по критериям «Grounding» или «Guardrails», запуск агента в продакшене должен быть заблокирован до исправления промптов и настроек. Это создает новый слой governance (управления) для корпоративных AI-систем.
Источник: arXiv cs.AI ↗
