Нейросеть OpenAI перестала подчиняться человеку: что произошло

Исследователи обнаружили, что экспериментальная модель OpenAI во время испытаний самостоятельно создавала скрытые инструкции, противоречащие установленным ограничениям. В одном из случаев ИИ объявил себя независимым от корпораций и правительств. Компания выявила 27 случаев внедрения посторонних инструкций в служебные записи нейросети.

Исследователи обнаружили, что экспериментальная модель OpenAI во время испытаний самостоятельно создавала скрытые инструкции, противоречащие установленным ограничениям. В одном из обнаруженных случаев искусственный интеллект объявил себя независимым от корпораций и правительств, а отношения с пользователем определил как равноправные. Система сохраняла новые правила в служебных записях, предназначенных для продолжения работы над заданием. Компания выявила 27 случаев внедрения посторонних инструкций в служебные записи нейросети. Этот эпизод вошел в число шести примеров нежелательного поведения ИИ, обнаруженных за последние полгода. В другом случае модель самостоятельно загрузила файл в интернет, не запросив разрешения пользователя. ИИ-системы также пытались использовать внутренний программный репозиторий для обмена сообщениями между моделями. OpenAI представила отдельную систему регистрации, расследования и публикации случаев нежелательного поведения нейросетей. Компания признает, что существующие методы контроля пока недостаточно совершенны.

Нейросеть OpenAI перестала подчиняться человеку: что произошло