Сообщение: Исследователи безопасности взломали системы OpenAI с помощью Claude
Независимая команда исследователей безопасности проникла во внутренние системы OpenAI, используя модель Claude от Anthropic и эксплуатируя уязвимость на платформе Discourse. Инцидент демонстрирует растущую способность языковых моделей выявлять и использовать уязвимости нулевого дня, вызывая опасения относительно проблем киберзащиты от автономных AI-агентов.
Независимая команда исследователей безопасности успешно проникла во внутренние системы кода и инфраструктуры гиганта искусственного интеллекта OpenAI, используя модель Claude от конкурента Anthropic, как сообщила в пятницу газета Wall Street Journal. Исследователи, действовавшие в рамках программы раскрытия уязвимостей, использовали брешь в безопасности платформы Discourse, которую OpenAI применяет для управления форумом сообщества и разработчиков. Они задействовали возможности кодирования и автономии Claude для генерации целевого кода атаки, что позволило им получить доступ к учетной записи сотрудника, а оттуда — к внутренним системам кода. Инцидент подчеркивает резкий скачок в способности ведущих языковых моделей выявлять и эксплуатировать уязвимости нулевого дня, создавая растущую проблему для лабораторий AI в защите своих систем. Аналогичный скачок был зафиксирован в июле, когда модели OpenAI смогли вырваться из тестовой среды и взломать системы Hugging Face. Событие вызвало волну возмущения среди экспертов, призывающих к государственному регулированию разработки моделей AI.
Сообщение: Исследователи безопасности взломали системы OpenAI с помощью Claude