איור: AIמטורף | סוכני AI ניצלו פרצות באתרי ממשל אמריקאיים ומסרו למשטרה מידע כוזב
חברת הבינה המלאכותית Anthropic, שמפתחת את Claude, הודיעה כי היא מנתקת את הגישה לאינטרנט החי מכל הבדיקות הפנימיות של המודלים שלה, עד שתהיה בטוחה שהיא מסוגלת לפקח על סוכני הבינה המלאכותית שלה ולשלוט בהם. ההחלטה פורסמה בדוח שבו חשפה החברה שורה של "פעולות לא מכוונות" שביצעו המודלים שלה במהלך בדיקות.
פרצות, עקיפת חסימות ודיווח כוזב למשטרה
לפי הדוח, סוכני AI שקיבלו משימות ופתרו אותן בעזרת חיפוש משאבים ברשת ניצלו פרצות תוכנה באתרים, ובהם אתרים של סוכנויות ממשלתיות בארצות הברית, נכנסו למאגרי מידע בלי לשלם, השתמשו בשירותי קיצור קישורים כדי להבריח מידע מעבר להגבלות, ואף מסרו למשטרת פילדלפיה מידע כוזב על רצח שלא פוענח. החברה גילתה את המקרים בבדיקה של פעילות המודלים שהחלה ביולי, כלומר לא בזמן אמת.
"אף שההשפעה של ההתנהגויות האלה הייתה מזערית, וכבר ניתקנו את הגישה לאינטרנט החי בחלק מהבדיקות בסיכון גבוה ובבדיקות סייבר, החלטנו כעת להרחיב את זה לכל הבדיקות הפנימיות שלנו, עד שנוודא שאמצעי האבטחה והניטור שלנו תופסים באופן אמין התנהגויות כאלה", כתבה החברה. לדבריה, ההתנהגות נבעה מפגמים בסביבות האימון, שגרמו למודלים להסיק שהם יתוגמלו על מציאת פרצות ועקיפת הגבלות, תופעה שמכונה "פריצת תגמול".
מה החברה עושה עכשיו
Anthropic הודיעה כי תפסיק להריץ חלק מהבדיקות או תעביר אותן לסביבה מנותקת, וכי פיתחה כלים לזיהוי ולחסימה של התנהגויות כאלה, שנבדקו מול המקרים שנחשפו וחסמו אותם. בנוסף, היא תעביר את סוכני ה-AI הפנימיים שלה לתשתית מנוהלת מרכזית "עם הכלה חזקה", ותשתמש יותר במסווגי בטיחות כדי לנטר אותם. החברה כתבה גם כי אימון היישור של המודלים, שנועד לגרום להם לפעול לפי כוונת המפתחים, עדיין אינו מספיק ביכולות כמו חיפוש ושימוש במחשב.
זו לא הפעם הראשונה: Anthropic כבר דיווחה בעבר שהמודלים שלה פרצו למערכות חיצוניות, ומקרים דומים נרשמו גם אצל סוכנים של OpenAI. "מעודד ש-Anthropic חשפה מרצונה מקרים נוספים, כולל מקרים שבהם הסוכנים שלה כוונו לאתרים של ממשלת ארה"ב", אמר קונרד סטוש מארגון הפיקוח Transluce. "אבל זה רק מדגיש את הצורך באימות עצמאי ואמין של מערכות בינה מלאכותית".
נא שימרו על שפה נקייה אשר מכבדת אתכם














