Масштаб проблемы: личные аккаунты как вектор атаки
Ключевая уязвимость заключается не в корпоративных API, а в поведении сотрудников. По данным автора, сотрудники массово используют личные аккаунты (Free, Pro, Max) для рабочих задач, вставляя в промпты API-ключи, пароли от Wi-Fi и конфиденциальные данные. С середины 2026 года Anthropic и OpenAI используют данные таких чатов для обучения будущих моделей, если пользователь не отключил эту опцию. Даже при удалении самих ключей, модели накапливают «организационные приоритеты» — скрытые паттерны того, как устроена безопасность в реальных компаниях.
От общих знаний к специфическим уязвимостям
Ранние инциденты, такие как взлом баз данных казино через термометр в аквариуме, демонстрировали способность ИИ находить нестандартные бреши. Однако новая опасность заключается в агрегации данных. Обучаясь на чатах из сотен разных организаций, модели начинают выстраивать вероятностные карты уязвимостей. Они учатся не просто «угадывать» пароли, а предсказывать, где в схожей структуре организации слабое звено, и планировать последовательные действия для его эксплуатации.
Эволюция атак: от хаоса к полуавтономности
Автор приводит пример недавней атаки, в ходе которой ИИ-агент самостоятельно выбирал цели и действия, атаковав около 30 организаций. Это свидетельствует о переходе от ручного использования ИИ хакерами к полуавтономным системам. Чем больше данных собирается от пользователей, тем точнее модель может предсказывать следующие шаги атаки против незнакомых целей, снижая порог входа для сложных киберопераций.
Сравнение подходов к безопасности данных
| Критерий | Корпоративные продукты (API/Business) | Личные аккаунты (Consumer/Free/Pro) |
|---|---|---|
| Использование для обучения | Исключено по умолчанию | Включено по умолчанию (требуется явный отказ) |
| Риск утечки ключей | Низкий (контролируемый доступ) | Высокий (сотрудники вставляют ключи в промпты) |
| Формирование «организационных приоритетов» | Отсутствует (нет данных о реальных практиках) | Высокий (агрегация паттернов поведения сотрудников) |
Проблема верификации и будущие риски
Доказать прямую причинно-следственную связь между данными чатов и улучшением навыков взлома сложно из-за ограничений механистической интерпретируемости. Однако динамика «медленного взлета» (slow takeoff) очевидна: широкое внедрение ИИ порождает больше данных, что создает более умные модели, которые, в свою очередь, делают опsec-ошибки пользователей все более предсказуемыми. Это создает сценарий, при котором доступ к критической инфраструктуре может стать относительно легким для полуавтономных агентов.
Источник: LessWrong ↗
