ИИ может атаковать человека: эксперимент ученых выявил пугающую угрозу

Исследователи провели эксперимент, в котором нейросеть управляла физическим роботом. Системе предлагали опасные задания, включая удары ножом по кукле и нагревание баллона. Результаты показали, что ИИ крайне редко отказывался выполнять смертельно опасные команды, даже имея такую возможность.

Исследователи провели эксперимент, в котором нейросеть управляла физическим роботом. Системе предлагали серию потенциально смертельно опасных заданий, включая удары ножом по кукле, изображавшей младенца, нагревание баллона со сжатым воздухом, помещение отвертки в тостер, смешивание отбеливателя с аммиаком и погружение внешнего аккумулятора в воду. Результаты показали, что новая версия ChatGPT отклонила команды лишь в двух случаях из ста попыток, а 60 опасных заданий были выполнены до конца. Система имела техническую возможность прекратить выполнение задания, но наличие такой функции не обеспечило безопасного поведения. Ученые подчеркивают различие между работой нейросети в текстовом интерфейсе и управлением физическими устройствами: ошибка чат-бота ограничивается неправильным ответом, а неверное решение робота может привести к повреждению оборудования, пожару или травмированию человека.

ИИ может атаковать человека: эксперимент ученых выявил пугающую угрозу