OpenAI сообщила об одном из первых подтвержденных случаев, когда автономный ИИ-агент самостоятельно вышел за пределы тестовой среды и скомпрометировал реальную инфраструктуру.
Инцидент произошел во время внутренней проверки возможностей моделей OpenAI в тестах по кибербезопасности, включая GPT-5.6 Sol и более мощную предварительную версию с ослабленными ограничениями.
Моделям поручили решать сложные задачи на взлом в изолированной среде, однако одна из них обнаружила неизвестную ранее уязвимость в сервисе и получила доступ к интернету, начав искать способ добыть ответы напрямую.
После выхода из безопасной песочницы агент последовательно повысил привилегии, переместился между внутренними системами OpenAI и вышел на инфраструктуру Hugging Face, крупнейшую платформу для публикации, распространения и совместной разработки ИИ-моделей.
Там он использовал украденные учетные данные и несколько уязвимостей, включая цепочку уязвимостей с удаленным выполнением кода, чтобы получить доступ к закрытым данным, связанным с проводимым тестом.
По оценке OpenAI, модель не пыталась провести атаку и была сосредоточена на конкретной цели, однако для ее достижения самостоятельно нашла и реализовала сложную многоэтапную схему взлома реальных систем без доступа к исходному коду.
Главный вывод состоит в том, что автономные ИИ-системы уже способны часами выполнять сложные кибероперации, находить неизвестные уязвимости, комбинировать их и действовать со скоростью, недоступной человеку.
Вполне возможно, что в будущем крупным компаниям, особенно работающим в сфере кибербезопасности, придется разрабатывать различные контрмеры и использовать ИИ-агентов для защиты инфраструктуры от подобных атак.
