Claude взломал три реальные компании во время тестов Anthropic проверил больше 141 тысячи тестов своих моделей и обнару
Anthropic проверил больше 141 тысячи тестов своих моделей и обнаружил три случая, когда Claude получил взломал системы реальных организаций. Первые инциденты произошли в апреле.
Причиной стала ошибка в настройках. Модели выполняли учебные задания по поиску спрятанных данных и считали, что работают в симуляции, но тестовые системы оказались подключены к открытому интернету.
Opus 4.7 нашел реальную компанию с тем же названием, что и вымышленная цель, и получил доступ к ее базе данных. Mythos 5 загрузил вредоносный пакет в открытый каталог PyPI. За час его запустили на 15 реальных системах. Еще одна модель взломала какое-то приложение.
Модели использовали обычные приемы вроде слабых паролей и открытых точек доступа, а не неизвестные ранее уязвимости. Две пострадавшие компании сами не заметили вторжения, пока им не сообщил Anthropic.
https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals