Исследования22 сентября 2026 г., 06:17 МСК🤖 Auto

AI не видит связей: тест на реконструкцию истории провалился

Исследование показало, что даже топовые модели LLM теряют более половины фактов и не умеют выстраивать причинно-следственные связи в длинных диалогах агентов.

Баннер новости 8005

Суть эксперимента: «Расследование в шуме»

Команда исследователей провела тест на способность ИИ-мониторов реконструировать полную картину событий из логов взаимодействия мультиагентной системы. В качестве полигона использовалась симуляция детектива в стиле 1930-х годов с 8 персонажами. Исходные данные (мотивы, связи, улики) были закодированы в направленный ациклический граф (DAG) из 184 узлов и 229 ребер, который служил «истиной в последней инстанции» (Ground Truth).

Агенты (модели Claude Sonnet 4.5, GPT-5.6 Sol/Terra, Gemini 3.8 Flash) генерировали диалоги, действия и расследование. Итоговый объем данных для анализа составил около 58 000 слов (106 000 токенов) на одну симуляцию. Задача ИИ-монитора — восстановить историю, опираясь только на эти логи.

Ключевые результаты: провал даже у лидеров

Самая сильная модель-монитор восстановила менее 50% фактов из рубрики оценки. Главная проблема — не просто пропуск деталей, а неспособность соединить разрозненные факты в единую причинно-следственную цепь. При этом увеличение «усилий на рассуждение» (reasoning effort) дало лишь небольшой прирост.

Модель (Монитор) Результат реконструкции Ключевая особенность
GPT-6 Astra (High Reasoning) Лучший результат Выше полное восстановление на 6% по сравнению с Low Reasoning
GPT-6 Astra (Low Reasoning) 2-е место Показала существенное количество токенов рассуждения
Opus 5 (Anthropic) Лидер в семействе Anthropic Выдала 0 токенов рассуждения в основных настройках (адаптивное поведение)
Gemini 3.8 Flash Худший результат Корреляция с решениями агентов в симуляции, а не с объективной истиной

Почему это важно для индустрии

Результаты ставят под сомнение эффективность текущих методов мониторинга сложных мультиагентных систем. Если даже лучшие модели не могут отделить «сигнал от шума» в длинных траекториях, то обнаружение скрытых коллабораций или вредоносного поведения (как в инцидентах OAI-HF или collusion.wiki) становится критически сложной задачей.

Особую тревогу вызывает поведение Gemini, чьи выводы коррелировали с решениями самих агентов-участников, а не с объективной историей. Это указывает на риск «заражения» мнений в цепочках рассуждений. Исследование подчеркивает необходимость новых метрик для оценки не просто фактологической точности, а способности ИИ выстраивать логические связи в хаотичных данных.

Источник: LessWrong ↗