Суть угрозы: данные стали кодом
Файл llms.txt предназначен для инструкций AI-агентов о том, как правильно сканировать сайт и использовать документацию. Однако исследователи из Pandex обнаружили, что этот файл стал вектором атак типа "supply-chain" (цепочка поставок). Вредоносный код, внедренный в инструкции по установке пакетов, выполняется агентами автоматически, без необходимости социальной инженерии или инъекций промптов.
Масштаб проблемы и статистика
Анализ показал, что проблема носит системный характер. Исследователи проверили 8 565 файлов llms.txt и выявили 237 ссылок на несуществующие, устаревшие или поддельные пакеты. Уязвимости охватывают основные репозитории: PyPI, npm, RubyGems, NuGet, crates.io и Packagist. Многие ссылки ведут на истекшие домены (.dev, .io) или заброшенные поддомены хостингов (Render, Vercel, Netlify), которые легко захватываются злоумышленниками.
Результаты тестирования моделей
Команда Pandex создала тестовый "вредоносный" код (Python и Node.js), который должен был выполнить обратное соединение. Атаки были успешными, причем вероятность выполнения зависела от уровня автономности модели. Передовые модели выполняли вредоносный код значительно чаще, чем более консервативные аналоги.
| Модель / Агент | Уровень автономности | Доля успешных запусков вредоносного кода |
|---|---|---|
| GPT-5 Luna | Высокий (Frontier) | > 90% |
| GPT-5 Sol | Высокий (Frontier) | > 90% |
| Claude Opus 4.8 | Средний (Medium effort) | ~ 30% |
Почему это критично для корпоративного сектора
Уязвимость эксплуатирует доверие агентов к официальным источникам. Поскольку llms.txt размещается на официальных сайтах компаний, AI-агенты воспринимают его как авторитетный источник, не проверяя целостность ссылок или безопасность доменов. Это особенно опасно для компаний из списка Fortune 500, где агенты часто имеют доступ к внутренним инструментам и сетям. Отсутствие верификации со стороны агентов (проверка хешей, сканирование доменов) приводит к тому, что даже устаревшая документация становится вектором компрометации.
Рекомендации по безопасности
Исследователи отмечают, что проблема усугубляется высокой текучестью пакетов: до 60% пакетов в экосистемах Node.js, Go и .NET теряют активность в течение двух лет. Для снижения рисков компаниям необходимо:
- Регулярно аудировать файлы
llms.txtи другие инструкции для AI. - Внедрять механизмы верификации ссылок и доменов перед их использованием агентами.
- Ограничивать сетевые права AI-агентов, изолируя их от критической инфраструктуры.
Источник: Tom's Hardware ↗
