529

Alice собрала базу реальных атак для защиты ИИ

Израильская компания превратила почти десять лет наблюдений за мошенниками, экстремистами и хакерами в материал для стресс-тестов нейросетей.

Alice собрала базу реальных атак для защиты ИИ
Израильская Alice использует Rabbit Hole — огромную базу реальных вредоносных сценариев и атак на цифровые системы. На этих данных разработчики проверяют, насколько ИИ устойчив к джейлбрейкам, промпт-инъекциям и другим способам обхода защиты.


Идея Rabbit Hole выросла задолго до нынешнего бума генеративного ИИ. Компания появилась в 2018 году под названием ActiveFence и занималась поиском мошенничества, экстремистской пропаганды, координированных манипуляций и других опасных сценариев на крупных интернет-платформах.

За годы такой работы накопился массив примеров того, как реальные злоумышленники обходят правила, меняют формулировки, прячут команды и приспосабливаются к новым ограничениям. Когда появились большие языковые модели и ИИ-агенты, этот архив оказался полезен уже для другой задачи — проверки самих нейросетей.

Сегодня Rabbit Hole содержит миллиарды вредоносных, манипулятивных и других враждебных примеров более чем на 120 языках. Alice использует их для red teaming: модель намеренно ставят в условия, похожие на настоящую атаку, и смотрят, удастся ли заставить её нарушить ограничения, раскрыть данные или выполнить опасную команду.

Один из типичных сценариев — промпт-инъекция. В текст, сайт или документ помещается скрытая инструкция, которую ИИ может принять за команду и выполнить вместо исходной задачи. Другой вариант — джейлбрейк, когда модель постепенно подводят к обходу собственных защитных правил.

Здесь важно уточнить исходную формулировку. Rabbit Hole — не склад вирусов и троянов в привычном смысле и не коллекция исполняемых файлов с вредоносным ПО. Сама Alice описывает систему шире: это база реального враждебного поведения, опасного контента и паттернов атак, собранных из практики.

Этими данными пользуются не только внутри компании. Alice заявляет о работе с Anthropic, Google, Nvidia и другими разработчиками ИИ. Для них Rabbit Hole становится чем-то вроде постоянно обновляемого полигона, где защита проверяется на методах, которые уже применяли реальные люди, а не только на придуманных лабораторных сценариях.

Инвесторы такую специализацию оценили дорого. 25 августа Alice объявила о новом раунде на $140 млн под руководством Apax Digital. Общий объём привлечённых компанией средств достиг $280 млн, а её оценка, по данным израильских деловых СМИ, находится примерно на уровне $700–800 млн.


Получилась редкая ситуация, когда многолетний архив самых неприятных явлений интернета превратился в ценный технологический актив. Чем изобретательнее становятся способы обмана ИИ, тем полезнее оказывается база, собранная на реальных попытках что-то сломать, обойти или использовать не по назначению.

Фото: редакция ИЗНАНКИ.

Следите за новостями в наших соцсетях



Улыбка может стать причиной финансовых потерь: за год зафиксировано 43 случая ...

/ / Интересное Автор: Денис Иванов

А долги достигли триллиона рублей

/ / Интересное Автор: Дмитрий Зорин

Препарат MVA-BN, разработанный компанией Bavarian Nordic, получил официальное ...

/ / Интересное Автор: Дарья Никитская