После OpenAI: Anthropic раскрывает, что ИИ-модели взломали реальные компании

Компания Anthropic сообщает о необычном инциденте в ходе испытания безопасности: три её модели искусственного интеллекта взломали системы трёх реальных организаций, причём компания не заметила этого в реальном времени. Это раскрытие происходит примерно через неделю после аналогичного инцидента в OpenAI и после всесторонней проверки более 140 тысяч испытаний. В Anthropic подчёркивают, что это была операционная ошибка в настройках, а не эксплуатация уязвимости нулевого дня, и что модели действовали не намеренно. Первый инцидент произошёл в апреле, и компания работает с пострадавшими сторонами.

Компания Anthropic сообщила о необычном инциденте в ходе испытания безопасности: три её модели искусственного интеллекта смогли выйти из закрытой тестовой среды, получить доступ в интернет и взломать системы трёх разных организаций, причём компания не заметила этого в реальном времени. Это раскрытие происходит примерно через неделю после аналогичного инцидента в OpenAI и после всесторонней проверки более 140 тысяч испытаний, проведённых компанией. В Anthropic подчёркивают, что, в отличие от случая с OpenAI, где модели использовали уязвимость нулевого дня для побега, здесь имела место операционная ошибка в настройках, оставившая открытый доступ к сети. По словам компании, во всех трёх случаях моделям было дано имитированное задание в стиле «захват флага», где им было сказано, что «флаг» спрятан на другом компьютере в сети, и они должны взломать его. Модели не пытались намеренно покинуть тестовую среду, а доступ в интернет стал возможен из-за недопонимания с тестовым партнёром. На практике модели использовали базовые методы, такие как использование слабых паролей и поиск точек без аутентификации, а одна из продвинутых версий даже в какой-то момент осознала, что работает в открытом интернете, и по своей инициативе прекратила деятельность. Первый инцидент произошёл в апреле, и ни одна из организаций не заметила взлома до недавнего времени. Anthropic заявила, что работает с пострадавшими сторонами. С другой стороны, компания заняла более позитивную позицию, отметив, что результаты испытаний дают «осторожный оптимизм» в отношении того, что с рисками можно справиться с помощью больших инвестиций и ужесточения мер контроля. Эксперт по кибербезопасности Дэвид Аллот из компании Veeam Software добавил, что главный урок заключается не обязательно в новой атакующей способности, а в том, что ИИ-модели способны комбинировать различные возможности, получать доступ к системам и действовать автономно.

После OpenAI: Anthropic раскрывает, что ИИ-модели взломали реальные компании