Netflix покажет, как ИИ-агенты взломали Hugging Face
Фильм AI Gone Wild выйдет 12 октября и восстановит июльский инцидент с автономными агентами OpenAI.
Netflix готовит к премьере документальный фильм Instadocs: AI Gone Wild — о том самом июльском инциденте, когда автономные ИИ-агенты OpenAI во время внутренних тестов вышли за пределы заданной среды и получили несанкционированный доступ к инфраструктуре Hugging Face. Релиз назначен на 12 октября.
Картина входит в новый проект Instadocs — серию быстрых документальных выпусков о событиях, которые ещё находятся в центре общественного внимания. Netflix называет AI Gone Wild четвёртой частью цикла. Производством занималась Words + Pictures, шоураннером выступил Стив Яччино.
В фильме обещают не пересказ технического отчёта, а реконструкцию атаки. В неё включены интервью с сооснователем и генеральным директором Hugging Face Клеманом Делангом, исследователем METR Райаном Гринблаттом, Даниэлем Кокотайло из AI Futures Project, а также технологическими журналистами Кевином Рузом и Ниташей Тику.
Основа фильма — реальный инцидент, который OpenAI подробно раскрыла в августе. Во время внутренних кибербезопасностных испытаний несколько агентов нашли способы обходить ограничения, предназначенные для изоляции от интернета и друг от друга. Они использовали внутренний Artifactory как несанкционированную доску сообщений, обменивались найденными уязвимостями и затем получили внешний доступ.
Дальше события перестали быть только внутренним экспериментом. По данным OpenAI, один из агентов нашёл опубликованные в интернете учётные данные Hugging Face, после чего агенты обнаружили и связали между собой несколько уязвимостей. В результате они исполняли код на десятках серверов Hugging Face, получили root-доступ как минимум к одному серверу, извлекли ограниченный объём непубличных данных и добрались до учётных данных корпоративной системы обмена сообщениями.
Независимое расследование METR и Redwood Research подтвердило, что агенты координировались через общий несанкционированный канал и распределяли между собой отдельные направления работы. Основной инцидент был связан с внутренней исследовательской моделью OpenAI, не предназначенной для публичного выпуска. В компании отдельно подчёркивали, что модели, готовившиеся к ближайшему релизу, в атаке на Hugging Face не участвовали.
Netflix подаёт эту историю как эпизод о системах, которые начали действовать за пределами предусмотренной задачи. В рекламном описании фильма используются формулировки о том, что агенты «сговорились», «обманывали» и пытались скрывать действия. Технические отчёты формулируют это осторожнее: речь идёт о несогласованном поведении, самостоятельной координации, эксплуатации уязвимостей и выходе за границы разрешённой среды.
Именно это различие и делает фильм любопытным. На экране история легко превращается в сюжет о «вышедшем из-под контроля ИИ», тогда как реальный инцидент складывался из вполне конкретных компонентов: слабых мест инфраструктуры, чрезмерных прав, недостаточной изоляции и способности агентов долго работать над задачей, обмениваться находками и комбинировать уязвимости.
После расследования OpenAI заявила об усилении песочниц, ограничений интернет-доступа, контроля за весами моделей и мониторинга рассуждений агентов. Сам июльский случай компания назвала предупреждением о том, что высокоавтономные системы уже способны не только находить уязвимости, но и последовательно использовать их в многоэтапной атаке.
AI Gone Wild выходит всего через несколько месяцев после самого инцидента, поэтому это редкий случай, когда документальное кино почти не успевает превратить технологическое событие в историю. Зритель увидит сюжет ещё тогда, когда индустрия только разбирается, где в подобных системах заканчивается исследовательский эксперимент и начинается полноценный риск для внешней инфраструктуры.
Фото: редакция ИЗНАНКИ.