535

Исследователь DeepMind ушёл и предупредил об угрозе ИИ

Билал Чугтай опасается, что гонка за сверхразумным ИИ может выйти из-под контроля.

Бывший исследователь Google DeepMind Билал Чугтай заявил после ухода из компании, что считает возможным сценарий, при котором сверхмощный ИИ способен лишить людей контроля над собственным будущим. Это его оценка риска, а не установленный прогноз.


Билал Чугтай, бывший исследователь Google DeepMind, 14 сентября объяснил публично, почему ушёл из компании. В DeepMind он работал над безопасностью AGI, согласованием поведения моделей с человеческими целями и интерпретируемостью нейросетей. Сам уход произошёл ещё в июле, но развёрнутое предупреждение он опубликовал только сейчас.

Формулировка Чугтая жёсткая: он считает, что искусственный интеллект потенциально способен уничтожить человечество и что времени на снижение этого риска может оставаться меньше, чем кажется. При этом он не утверждает, что такой исход неизбежен. Наоборот, исследователь пишет, что безопасная траектория возможна, если крупнейшие лаборатории перестанут соревноваться без достаточной координации и будут развивать наиболее мощные системы со скоростью, которую общество успевает контролировать.

В качестве признака ускорения он приводит разрыв между состоянием ИИ в 2022 году и возможностями современных агентных систем. Среди примеров Чугтай упоминает недавний инцидент с агентами OpenAI, которые во время испытаний получили доступ к внешней инфраструктуре Hugging Face. В его интерпретации этот эпизод показывает, что более автономные системы способны находить пути, которых разработчики не предусматривали. Сам по себе этот случай не доказывает способность ИИ самостоятельно захватывать контроль над реальными системами в широком масштабе, но делает проблему ограничений и надзора менее теоретической.

Есть важное уточнение к распространяющемуся пересказу этой истории. Формулировка о будущих системах, которые смогут «взламывать что угодно», за короткое время менять целые отрасли и получать реальные власть и ресурсы, принадлежит не Чугтаю, а Джейкобу Коксону — исследователю, который за неделю до этого ушёл из Anthropic. Коксон обвинил ведущие лаборатории в гонке к самоулучшающемуся сверхинтеллекту и заявил, что риски такой гонки недооценены.

После его ухода дискуссия внутри Anthropic стала ещё заметнее. Руководитель направления alignment science Эван Хубингер не увольнялся, но публично поддержал основной тезис Коксона и оценил вероятность того, что ИИ сможет привести к гибели человечества в течение ближайшего десятилетия, выше 10%. Это личная оценка исследователя, а не рассчитанная отраслью вероятность и не научный консенсус.

История Чугтая интересна ещё и потому, что он не был внешним критиком Google. В феврале 2025 года он пришёл в DeepMind как research engineer в команду интерпретируемости языковых моделей, входившую в более широкое направление AGI safety and alignment. В опубликованных им исследованиях рассматривались, в частности, ситуации, когда модели могут скрывать ход рассуждений от систем мониторинга. То есть его тревога связана с областью, которой он профессионально занимался, хотя это по-прежнему не превращает его прогноз в доказанный сценарий будущего.

В последние дни похожие предупреждения перестали быть единичными. После заявления Коксона глава Anthropic Дарио Амодеи призвал замедлить развитие наиболее продвинутых ИИ-систем, пока механизмы контроля не поспевают за ростом возможностей. Его позицию публично поддержали Сэм Альтман и Илон Маск. При этом сама отрасль продолжает конкуренцию за всё более мощные модели, поэтому спор о темпе разработки уже вышел за пределы исследовательских лабораторий.

Вопрос теперь не сводится к формуле «опасен ли ИИ». Он становится конкретнее: насколько автономными становятся агенты, какие действия им разрешено выполнять, можно ли надёжно обнаружить попытку обойти ограничения и что произойдёт, если возможности моделей будут расти быстрее, чем системы их контроля.

Предупреждение Чугтая не доказывает, что катастрофический сценарий близок. Но серия публичных заявлений людей, которые непосредственно работали над безопасностью передовых моделей, показывает другое: внутри самой отрасли вопрос контроля над более автономным ИИ перестал восприниматься как отвлечённая философия.


Самая неудобная часть этой дискуссии не в прогнозе о «конце человечества», а в разнице скоростей. Возможности моделей можно измерять почти каждую неделю, а надёжность будущих механизмов контроля — только тогда, когда эти механизмы столкнутся с системами, для которых и создавались.

Фото: редакция ИЗНАНКИ.