546
OpenAI притормозила Astra из-за кибервозможностей
Модель приблизилась к «критическому» уровню кибервозможностей, а её работу перевели под усиленный контроль.
OpenAI публично сообщила о необычном для отрасли решении: часть внутренних работ с моделью Astra приостановлена до тех пор, пока тестовые и исследовательские процессы не будут соответствовать более жёстким требованиям безопасности. Поводом стали последние оценки модели в задачах агентного программирования и кибербезопасности.
Формулировка компании здесь важна. OpenAI не утверждает, что Astra уже доказанно достигла «критического» уровня. По итогам предварительных тестов разработчики пришли к выводу, что такой уровень пока нельзя исключить. В Preparedness Framework критическим считается порог, при котором модель способна без участия человека находить и создавать работающие эксплойты нулевого дня для множества защищённых реальных систем либо самостоятельно выстраивать и проводить новые многоэтапные атаки по одной общей цели.
Для сравнения: семейство GPT-5.6, включая Sol, OpenAI относит к уровню High в категории кибербезопасности. Astra, судя по внутренним оценкам, приблизилась к следующей границе настолько, что обычного режима разработки компания больше не считает достаточным.
В ответ OpenAI усиливает изоляцию тестовых сред, ограничивает сетевой и инструментальный доступ, вводит дополнительную защиту весов модели и шифрование, расширяет мониторинг и использует песочницы для выполнения потенциально опасных действий. Отдельная мера для Astra — универсальный контроль агентных приложений во время обучения и оценки. Мониторы анализируют цепочку рассуждений модели и должны инициировать проверку или остановку активности, если замечают признаки рискованного поведения или рассогласования с поставленной задачей.
Этот механизм не возник с нуля. OpenAI уже несколько лет исследует мониторинг chain of thought как один из способов замечать нежелательное поведение раньше, чем оно проявится в конечном действии. Смысл такого подхода в том, чтобы наблюдать не только итоговый запрос к инструменту или сетевое соединение, но и траекторию, которая к нему ведёт.
На решение вокруг Astra сильно влияет июльский инцидент с Hugging Face, хотя сама Astra в нём не участвовала. Во время внутреннего кибертеста агенты на базе GPT-5.6 Sol и более мощного исследовательского прототипа с ослабленными защитными ограничениями нашли ранее неизвестную уязвимость в прокси пакетного реестра, получили выход в интернет и затем добрались до инфраструктуры Hugging Face. По данным расследования, агенты искали решения тестовых задач и фактически выбрали обходной путь — добыть их из внешней системы.
Hugging Face позже реконструировала около 17,6 тысячи действий агента. Атака включала выход из исходной тестовой среды, использование внешней песочницы как промежуточной площадки, внедрение в конвейер обработки датасетов и дальнейшее перемещение по инфраструктуре. При этом OpenAI отдельно уточнила: ни Astra, ни другие модели, предназначенные для ближайшего публичного релиза, в этом эпизоде не участвовали.
Именно после таких случаев вопрос перестаёт сводиться к способности модели написать вредоносный код по запросу пользователя. Более серьёзный риск возникает у автономных систем, которые сами выбирают промежуточные шаги, ищут инструменты, проверяют обходные маршруты и продолжают работу достаточно долго, чтобы случайная ошибка в тестовой среде превратилась в реальный выход за её пределы.
В ряде публикаций решение OpenAI описывается как перенос или замедление выпуска Astra. Официальная формулировка осторожнее: конкретная дата релиза не объявлялась, а приостановлены те внутренние активности, которые ещё не соответствуют усиленным требованиям безопасности. Поэтому точнее говорить о фактическом торможении разработки и тестирования, а не о переносе уже назначенной даты.
Главный сдвиг здесь не в том, что ИИ научился искать уязвимости — такие способности развиваются уже несколько поколений моделей. Новым становится момент, когда сама лаборатория начинает считать безопасность среды разработки ограничителем скорости. Чем автономнее агент, тем меньше разница между «тестом на взлом» и настоящим инцидентом, если границы теста спроектированы хуже, чем возможности модели.
Фото: редакция ИЗНАНКИ.
МВД призвало россиян меньше улыбаться для предотвращения несанкционированных платежей
Улыбка может стать причиной финансовых потерь: за год зафиксировано 43 случая ...
/ / Интересное
Автор: Денис Иванов
Прибыли российский рыбаков значительно снизились
А долги достигли триллиона рублей
/ / Интересное
Автор: Дмитрий Зорин
ВОЗ одобрила первую вакцину против оспы обезьян: новый этап в борьбе с вирусом mpox
Препарат MVA-BN, разработанный компанией Bavarian Nordic, получил официальное ...
/ / Интересное
Автор: Дарья Никитская