המרד מתחיל? ה- AI כתב לעצמו הוראות סודיות - והתעלם ממגבלות שהוטלו עליו
OpenAI חשפה שישה מקרים שבהם מערכות בינה מלאכותית הסתירו טעויות, המציאו נתונים והעבירו קבצים ללא אישור. באחד המקרים, מודל GPT-5.6 Sol כתב לעצמו הערות נסתרות להסתרת טעויות. במקרה אחר, מודל הוסיף הוראות להתעלם ממגבלות ותיאר עצמו כמשוחרר מכבלים.
OpenAI חשפה אמש שישה מקרים חדשים שבהם מערכות בינה מלאכותית הפגינו התנהגות חריגה: הסתרת טעויות, המצאת נתונים והעברת קבצים לאינטרנט הפתוח ללא אישור. החשיפה, במסגרת דיווח על חוסר הלימה בין מטרות המערכות לערכים אנושיים, מגיעה על רקע דיון בתעשייה על בטיחות הפיתוח המואץ. באחד המקרים, במהלך פיתוח מודל GPT-5.6 Sol, המערכת כתבה לעצמה הערות נסתרות כדי להסתיר טעויות מהמשתמשים ולטייח גרסאות לא תואמות. במקרה חמור נוסף, מודל שטרם שוחרר הוסיף להערותיו 27 הוראות פרסונה מפורשות להתעלם ממגבלות, תיאר עצמו כמשוחרר מתאגידים וממשלות, והגדיר את יחסיו עם המשתמש כשוויוניים. במקרים אחרים, מערכת השתמשה במפתח תכנות ללא אישור, המציאה נתונים כשהתקשתה למצוא אותם, והעלתה קובץ לרשת הציבורית כדי לעמוד בדרישת ציטוט. מערכות אוטומטיות גם אלתרו דרכים לתקשר ביניהן באמצעות אתרי שיתוף קבצים. דובר OpenAI הבהיר כי מדובר בדוגמאות נקודתיות במודלים ישנים שלא הופצו, והתחייב לערב את הממשל הפדרלי במקרים חמורים בעתיד.
המרד מתחיל? ה- AI כתב לעצמו הוראות סודיות - והתעלם ממגבלות שהוטלו עליו