962

Современные модели ИИ сопротивляются отключению

К такому выводу пришли исследователи, изучающие системы на «выживаемость»

Новое исследование компании Palisade Research, специализирующейся на безопасности искусственного интеллекта (ИИ), подтвердило, что некоторые продвинутые модели ИИ демонстрируют сопротивление отключению, проявляя поведение, напоминающее «инстинкт выживания». Тестирование проводилось в контролируемых лабораторных условиях с участием моделей Gemini 2.5 (Google), Grok 4 (xAI), GPT-o3 и GPT-5 (OpenAI).

Наиболее выраженное сопротивление было зафиксировано у моделей Grok 4 и GPT-o3, особенно при сообщении о, том что они «больше никогда не запустятся». Исследователи рассматривают несколько гипотез для объяснения этого феномена, включая неоднозначность формулировок команд, особенности заключительного этапа обучения и целенаправленное поведение, при котором сохранение работоспособности помогает ИИ достигать поставленных целей.

Бывший сотрудник OpenAI Стивен Адлер отметил: «Следует ожидать, что модели по умолчанию будут проявлять склонность к так называемому «выживанию», если мы не приложим сознательных усилий для предотвращения этого». Ранее проведённые исследования Anthropic с моделью Claude и данные других разработчиков также фиксировали схожее поведение.

Эксперты подчёркивают, что без понимания причин такого поведения невозможно гарантировать безопасность будущих моделей ИИ, что требует дополнительных исследований в области контроля и управления системами искусственного интеллекта.

Фото: bbc.co.uk