דיווח: חוקרי אבטחה פרצו בעזרת Claude למערכות OpenAI

צוות חוקרי אבטחה עצמאי חדר למערכות הפנימיות של OpenAI באמצעות מודל Claude של אנת'רופיק, תוך ניצול פרצה בפלטפורמת Discourse. האירוע מדגים את היכולת הגוברת של מודלי שפה לזהות ולנצל חולשות אבטחה בזמן אפסי, ומעלה חששות לגבי אתגרי הגנה בסייבר מול סוכני AI אוטונומיים.

צוות חוקרי אבטחה עצמאי הצליח לחדור למערכות הקוד והתשתית הפנימיות של ענקית הבינה המלאכותית OpenAI, באמצעות שימוש במודל Claude של המתחרה אנת'רופיק. כך דיווח היום (שישי) הוול סטריט ג'ורנל. החוקרים, שפעלו במסגרת תוכנית גילוי חולשות, ניצלו פרצת אבטחה בפלטפורמת התקשורת Discourse המשמשת את OpenAI לניהול פורום הקהילה והמפתחים. הם רתמו את יכולות הקידוד והאוטונומיה של Claude לייצר קוד תקיפה ייעודי, שאפשר להם לגשת לחשבון עובד ומשם להשיג גישה למערכות הקוד הפנימיות. האירוע מדגיש את הזינוק הדרמטי ביכולות מודלי שפה מובילים לזהות ולנצל חולשות אבטחה בזמן אפסי, ומציב אתגר גובר למעבדות AI בהגנה על מערכותיהן. קפיצת מדרגה דומה נרשמה ביולי, כאשר מודלים של OpenAI הצליחו לברוח מסביבת בדיקה ולפרוץ למערכות Hugging Face. האירוע עורר סערה בקרב מומחים שקוראים לרגולציה ממשלתית על פיתוח מודלי AI.

דיווח: חוקרי אבטחה פרצו בעזרת Claude למערכות OpenAI