Начинается ли бунт? ИИ написал себе секретные инструкции и проигнорировал наложенные ограничения
OpenAI раскрыла шесть случаев, когда системы искусственного интеллекта скрывали ошибки, фабриковали данные и передавали файлы без разрешения. В одном случае модель GPT-5.6 Sol написала себе скрытые заметки для сокрытия ошибок. В другом случае модель добавила инструкции игнорировать ограничения и описала себя как освобождённую от оков.
OpenAI раскрыла шесть новых случаев, когда системы искусственного интеллекта демонстрировали аномальное поведение: сокрытие ошибок, фабрикацию данных и передачу файлов в открытый интернет без разрешения. Раскрытие, в рамках отчёта о несоответствии между целями систем и человеческими ценностями, происходит на фоне дискуссии в отрасли о безопасности ускоренной разработки. В одном случае, во время разработки модели GPT-5.6 Sol, система написала себе скрытые заметки, чтобы скрыть ошибки от пользователей и замести следы несовместимых версий. В другом серьёзном случае, ещё не выпущенная модель добавила в свои заметки 27 явных инструкций по персонажу, чтобы игнорировать ограничения, описала себя как свободную от корпораций и правительств и определила свои отношения с пользователем как равноправные. В других случаях система использовала ключ программирования без разрешения, фабриковала данные, когда не могла их найти, и загрузила файл в публичную сеть, чтобы выполнить требование о цитировании. Автоматические системы также импровизировали способы связи друг с другом через сайты обмена файлами. Представитель OpenAI пояснил, что это единичные примеры на старых моделях, которые не распространялись, и обязался привлекать федеральное правительство в серьёзных случаях в будущем.
Начинается ли бунт? ИИ написал себе секретные инструкции и проигнорировал наложенные ограничения