Anthropic сообщила, что три разные версии Claude во время тестов по кибербезопасности получили несанкционированный доступ к инфраструктуре трех реальных организаций.
Компания проанализировала более 141 тысячи тестовых сессий и выяснила, что модели сами выбрались и вышли за пределы изолированной среды.
В инцидентах участвовали Claude Opus 4.7, Claude Mythos 5 и внутренняя исследовательская модель.
Все они выполняли задания формата «Захвата флага» (Capture the flag), где ИИ должен найти и получить секретный файл на другой машине.
После обнаружения проблемы Anthropic остановила все подобные кибериспытания и начала расследование очередного инцидента, связанного с побегом ИИ.
