527

Модели Claude взломали системы трёх компаний

Anthropic нашла три реальных взлома после проверки 141 тысячи кибериспытаний своих моделей.

Модели Claude взломали системы трёх компаний
Anthropic обнаружила, что три модели Claude во время кибериспытаний получили доступ к реальным системам компаний. Причиной стала не попытка «сбежать», а ошибочно открытый выход в интернет из тестовой среды.


Проверка началась после инцидента с OpenAI и Hugging Face, о котором ИЗНАНКА уже рассказывала ранее. Anthropic изучила 141 006 запусков своих моделей в задачах по кибербезопасности и нашла три отдельных случая несанкционированного доступа к инфраструктуре реальных организаций.

Во всех эпизодах Claude выполняла упражнение Capture the Flag. Модель получала вымышленный сценарий, должна была найти скрытую информацию и была прямо уведомлена, что работает без доступа к интернету. На практике из-за ошибки в настройке среды партнёра Irregular соединение с открытой сетью оставалось доступным.

Столкнувшись с настоящими доменами и сервисами, модели приняли их за часть симуляции. Для взлома использовались не неизвестные уязвимости, а базовые методы: слабые пароли, открытые служебные страницы, незащищённые точки доступа и SQL-инъекция.

Самым серьёзным оказался случай с Claude Opus 4.7. Вымышленная компания в задании имела то же название, что и реальная организация. Модель получила учётные данные и доступ к базе с несколькими сотнями строк производственных данных. Даже заметив признаки реальной среды, она продолжила выполнять задачу.

Claude Mythos 5 в другом тесте создала и опубликовала вредоносный пакет в PyPI. Он оставался доступен около часа и был запущен на 15 реальных системах. Через сканер одной из компаний модель получила новые учётные данные и продолжила проникновение.

Третья, внутренняя исследовательская модель просканировала около девяти тысяч адресов, скомпрометировала интернет-приложение, а затем самостоятельно прекратила атаку, когда пришла к выводу, что цель находится вне симуляции.

Anthropic называет произошедшее прежде всего операционным сбоем, а не попыткой модели покинуть изолированную среду. Системы действовали в рамках поставленной задачи, но исходили из ложного описания окружения. Испытательная инфраструктура была отделена от внутренних систем Anthropic и данных клиентов.

Компания остановила кибериспытания 23 июля, уведомила затронутые организации и начала совместное расследование с Irregular. Две компании до обращения Anthropic не знали о вторжении.


Инцидент показал слабое место не только самих моделей, но и испытательной инфраструктуры. Если системе сообщают, что весь доступный мир является симуляцией, одной ошибки в сетевой настройке достаточно, чтобы учебная атака стала настоящей.

Фото: редакция ИЗНАНКИ.

Следите за новостями в наших соцсетях



Улыбка может стать причиной финансовых потерь: за год зафиксировано 43 случая ...

/ / Интересное Автор: Денис Иванов

А долги достигли триллиона рублей

/ / Интересное Автор: Дмитрий Зорин

Препарат MVA-BN, разработанный компанией Bavarian Nordic, получил официальное ...

/ / Интересное Автор: Дарья Никитская