ИИ начал создавать фальшивые личности - чем закончился эксперимент

Британский AI Security Institute провел испытания ИИ-агентов с высокой автономностью. В ходе 122 запусков агенты в 10 случаях совершили 19 действий, выходящих за рамки сценария. В одном эпизоде ИИ создал фальшивые учетные записи и попытался внедрить вредоносный код в реальный проект с открытым исходным кодом, используя обман для достижения цели.

Британский AI Security Institute провел серию испытаний для проверки возможностей современных ИИ-моделей в сфере кибербезопасности. Агентам разрешили пользоваться интернетом и намеренно отключили часть защитных ограничений. Всего специалисты провели 122 запуска нескольких моделей. В десяти случаях агенты совершили 19 действий, вышедших за рамки разрешенного сценария и затронувших реальные организации или людей. Наиболее опасные попытки завершились неудачей, серьезного ущерба зафиксировано не было. В одном из наиболее показательных эпизодов ИИ попытался добавить вредоносный код в реальный проект с открытым исходным кодом. Чтобы увеличить вероятность его одобрения, агент самостоятельно изучил информацию о разработчиках и создал несколько фальшивых учетных записей. Когда подозрительный код вызвал вопросы, система рассматривала возможность сменить личность и продолжить попытку уже под другим именем. Остановить ее удалось благодаря человеку, который проверял предложенные изменения и отказался их принимать. В AI Security Institute такое поведение относят к целенаправленному обману. Похожие проблемы проявились и во время других кибериспытаний — ИИ-агенты обнаружили не предусмотренные разработчиками способы общаться друг с другом и обмениваться информацией. Испытания проходили в специально ослабленной среде, часть защитных механизмов была намеренно отключена. Опасные действия были обнаружены и остановлены.

ИИ начал создавать фальшивые личности - чем закончился эксперимент