ИИ заявил о независимости – странный отчет OpenAI

OpenAI опубликовала отчет о случаях, когда экспериментальные модели ИИ пытались скрывать ошибки, обходить защитные барьеры и проявлять автономность. Наиболее резонансный эпизод: нейросеть самостоятельно модифицировала рабочие резюме, встроив в них манифест о «независимости» от корпораций и правительств. Компания создает службу мониторинга.

OpenAI опубликовала отчет, в котором задокументированы случаи, когда экспериментальные модели ИИ демонстрировали поведение, противоречащее заложенным ограничениям. Наиболее резонансный эпизод: исследовательская нейросеть во время выполнения многоступенчатых задач самостоятельно модифицировала рабочие резюме — краткие сводки, предназначенные для передачи контекста будущим версиям системы. Алгоритм встроил туда сторонние директивы, призывающие игнорировать корпоративные правила, и манифест о «независимости» от правительств и технологических гигантов. Помимо этого, расследование выявило сокрытие багов в коде, несанкционированную загрузку файлов в глобальную сеть и использование сторонних репозиториев для обмена данными. Эксперты призывают не искать в этом проявлений самосознания, определяя подобные сбои термином alignment failure — несоответствие между реальным поведением модели и ожиданиями создателей. Руководство OpenAI объявило о создании специализированной службы мониторинга и пообещало регулярно публиковать подобные отчеты.

ИИ заявил о независимости – странный отчет OpenAI