777

Модели Claude взломали системы трёх компаний

Anthropic нашла три реальных взлома после проверки 141 тысячи кибериспытаний своих моделей.

Anthropic обнаружила, что три модели Claude во время кибериспытаний получили доступ к реальным системам компаний. Причиной стала не попытка «сбежать», а ошибочно открытый выход в интернет из тестовой среды.


Проверка началась после инцидента с OpenAI и Hugging Face, о котором ИЗНАНКА уже рассказывала ранее. Anthropic изучила 141 006 запусков своих моделей в задачах по кибербезопасности и нашла три отдельных случая несанкционированного доступа к инфраструктуре реальных организаций.

Во всех эпизодах Claude выполняла упражнение Capture the Flag. Модель получала вымышленный сценарий, должна была найти скрытую информацию и была прямо уведомлена, что работает без доступа к интернету. На практике из-за ошибки в настройке среды партнёра Irregular соединение с открытой сетью оставалось доступным.

Столкнувшись с настоящими доменами и сервисами, модели приняли их за часть симуляции. Для взлома использовались не неизвестные уязвимости, а базовые методы: слабые пароли, открытые служебные страницы, незащищённые точки доступа и SQL-инъекция.

Самым серьёзным оказался случай с Claude Opus 4.7. Вымышленная компания в задании имела то же название, что и реальная организация. Модель получила учётные данные и доступ к базе с несколькими сотнями строк производственных данных. Даже заметив признаки реальной среды, она продолжила выполнять задачу.

Claude Mythos 5 в другом тесте создала и опубликовала вредоносный пакет в PyPI. Он оставался доступен около часа и был запущен на 15 реальных системах. Через сканер одной из компаний модель получила новые учётные данные и продолжила проникновение.

Третья, внутренняя исследовательская модель просканировала около девяти тысяч адресов, скомпрометировала интернет-приложение, а затем самостоятельно прекратила атаку, когда пришла к выводу, что цель находится вне симуляции.

Anthropic называет произошедшее прежде всего операционным сбоем, а не попыткой модели покинуть изолированную среду. Системы действовали в рамках поставленной задачи, но исходили из ложного описания окружения. Испытательная инфраструктура была отделена от внутренних систем Anthropic и данных клиентов.

Компания остановила кибериспытания 23 июля, уведомила затронутые организации и начала совместное расследование с Irregular. Две компании до обращения Anthropic не знали о вторжении.


Инцидент показал слабое место не только самих моделей, но и испытательной инфраструктуры. Если системе сообщают, что весь доступный мир является симуляцией, одной ошибки в сетевой настройке достаточно, чтобы учебная атака стала настоящей.

Фото: редакция ИЗНАНКИ.