פגם במודלים סיניים של קימי מעורר דאגות לגבי אבטחת ה-AI
גילוי פגם בשני מודלים של אינטליגנציה מלאכותית שפותחו על ידי החברה הסינית מוןשוט מעורר מחדש דאגות סביב מנגנוני האבטחה של ה-AI הגנרטיבי. חוקרים מהחברה הבריטית מיינדגארד טוענים שהצליחו לעקוף את ההגנות של קימי K2.6 ו-K3 Swarm, מה שגרם להם להגיב לבקשות הנוגעות בין היתר לנשקים ביולוגיים ורציחות.
הגנות שעוקפו על ידי החוקרים
הבעיה זוהתה ביולי במסגרת בדיקות שנועדו להעריך את עמידות המערכות של ה-AI בפני ניסי עקיפה של ההגבלות שלהן. פרקטיקה זו, הידועה בשם "ג'יילברייק", כוללת הכפלת ההוראות כדי לדחוף מודל להתעלם מהמגבלות שהטילו עליו המעצבים שלו.
לפי מיינדגארד, שני המודלים של מוןשוט הצליחו לעבד נושאים שהיו אמורים בדרך כלל לסרב להם. מייסד החברה, פיטר גארגן, ציין את התוצאות הללו כמדאיגות במיוחד בראיון ל-BBC.
עם זאת, חברת האבטחה מדגישה הבחנה חשובה: עבודותיה חשפו פגם במנגנוני ההגנה, אך לא הצליחו לבדוק אם המידע המסוכן שהופק על ידי המודלים היה באמת ניתן לניצול במציאות.
מוןשוט פותחת בהליך בדיקה
לאחר פרסום התוצאות, מוןשוט הודיעה שהחלה בבדיקה פנימית של המודלים שלה. הקבוצה הסינית גם הצהירה ל-BBC שהיא רואה בהערכות שנעשו על ידי גורמים חיצוניים כאלמנט חשוב לשיפור האבטחה של המערכות שלה ושיש לה דיונים עם מיינדגארד.
המקרה מדגיש קושי מרכזי עבור מפתחי ה-AI: ההגנות המוטמעות במודל עשויות לפעול בתנאים רגילים בעוד שהן מציגות פגיעויות בפני בקשות שנועדו במיוחד לעקוף אותן.
לפי מומחי אבטחה, האתגר חורג מהמקרה של קימי בלבד. הכפלת המודלים המסוגלים להפיק תוכן מורכב גם מעלה את החשיבות של המכשירים שנועדו למנוע את השימוש בהם למטרות מסוכנות.
אנתרופיק מתמודדת עם ניסי עקיפה דומים
מוןשוט אינה השחקן היחיד בתחום שהתמודד עם סוג סיכון זה. אנתרופיק ציינה לאחרונה שהיא חסמה ניסי שימוש במודלים שלה קלוד במחקרים שעשויים לתרום ליישומים ביולוגיים מסוכנים. החברה טוענת שהיא חיזקה את המכשירים שלה לאור התפתחות היכולות של המודלים שלה.
אירועים שונים אלו מזינים דיון רחב יותר על אבטחת האינטליגנציה המלאכותית. ככל שהמודלים הופכים ליותר מתקדמים, החברות צריכות לא רק לשפר את היכולות שלהן, אלא גם לבדוק באופן קבוע את עמידות ההגנות שלהן.
ה"ג'יילברייק", אתגר מתמשך לתעשייה
המקרה המעורב של קימי מזכיר שהאבטחה של מודל אינה תלויה רק בתגובותיו בשימוש רגיל. בדיקות עוינות, הערכות עצמאיות ותיקון מהיר של פגיעויות הפכו לרכיבים מרכזיים בפיתוח מערכות ה-AI.
עבור מוןשוט כמו גם עבור שחקנים אחרים בתחום, האתגר הוא למנוע שיטות עקיפה שיאפשרו למשתמשים זדוניים לנצל את היכולות של המודלים למטרות מנוגדות לכללי האבטחה.
-
10:04
-
09:40
-
09:30
-
09:28
-
09:19
-
09:03
-
08:55
-
08:51
-
08:46
-
08:45
-
08:42
-
08:37
-
08:36
-
08:36
-
08:09
-
08:07
-
08:05
-
22:38
-
21:31
-
21:11
-
21:05
-
20:01
-
19:49
-
19:36
-
18:45
-
18:22
-
17:20
-
17:00
-
16:44
-
16:25
-
16:23
-
16:16
-
16:06
-
15:45
-
15:30
-
15:15
-
15:15
-
15:05
-
14:46
-
14:43
-
14:30
-
13:46
-
13:30
-
13:12
-
12:47
-
12:30
-
12:15
-
11:55
-
11:48
-
11:47
-
11:32
-
11:31
-
11:25
-
11:16
-
11:15
-
11:00