Ловушка линейной логики в AI-оценке
Новая работа, опубликованная в arXiv (28 июля 2026 г.), ставит под сомнение стандартную практику использования бенчмарков. Авторы показывают, что оценка ИИ — это не одномоментный акт, а цепочка умозаключений. Оценщики экстраполируют результаты с одной задачи на другую, переносят их на другие системы и делают выводы о человеческом контроле. Проблема в том, что «подтвержденные звенья не автоматически образуют подтвержденную цепь».
Принцип непроводимости (Non-composition principle)
Ключевой вывод исследования: поддержка для соседних проекций (переходов от известного к неизвестному) оправдывает их объединение только при строгом совпадении конечных точек, допущений и учете зависимостей. Если система, популяция или условия меняются на стыке этапов, цепочка аргументов рушится. Автор вводит понятие projectibility audit (аудит проецируемости) для выявления таких «неподдерживаемых соединений».
Эмпирические доказательства: симуляции и кейсы
Исследование опирается на юридический кейс и переанализ данных. Показано, что агрегированная стабильность результатов может стирать важные различия, необходимые для последующих проекций. Даже если отдельное исследование и исследование развертывания звучат корректно, они могут быть параллельными и не дополнять друг друга.
| Элемент оценки | Стандартный подход | Выявленная проблема (Projectibility) |
|---|---|---|
| Обобщение | Результат на Task A применяется к Task B | Скрытые изменения в распределении данных или условиях |
| Перенос системы | Результаты модели X экстраполируются на модель Y | Зависимость от lineage (происхождения) данных и архитектуры |
| Агрегация | Средние баллы по множеству тестов | Стирание дисперсии, критичной для конкретных сценариев |
Почему это важно для индустрии
Для разработчиков и регуляторов это означает необходимость перехода от простого подсчета баллов к аудиту логических связей между этапами валидации. Без учета «проективности» заявления о способности ИИ к сложным задачам остаются спекулятивными, даже если базовые бенчмарки пройдены успешно.
Источник: arXiv cs.AI ↗
