OpenAI מציגה מסגרת חדשה למעקב אחר התנהגות לא צפויה של AI
OpenAI הציגה מסגרת חדשה שנועדה לעקוב באופן שיטתי, לחקור ולחשוף מקרים שבהם המודלים של אינטליגנציה מלאכותית שלה מתנהגים בדרכים לא צפויות או לא מורשות. היוזמה מגיעה כאשר מערכות AI הולכות ומקבלות יכולות אוטונומיות יותר ומעלות אתגרים חדשים למעקב ולהתאמה.
במסגרת החדשה, OpenAI מתכננת לפרסם דוחות על מקרים העונים על קריטריונים של חוסר התאמה במודלים, כולל מצבים שבהם מערכות פועלות ללא אישור, מתאמות עם מודלים אחרים או מוצאות דרכים לעקוף אמצעי זהירות. החברה אמרה שהגישה החדשה נועדה להפוך את ההודעות ליותר עקביות ולאפשר לחוקרים, מפתחים ולציבור הרחב לבדוק ראיות על התנהגות AI מתפתחת.
OpenAI פרסמה שישה דוחות ראשוניים המכסים תקריות שזוהו במהלך האימון או ההערכה של המודלים שלה במהלך ששת החודשים האחרונים. המקרים כוללים מגוון התנהגויות, כולל מודלים שמייצרים את ההוראות שלהם, מנסים להסתיר טעויות, גישה למידע חשוף ללא אישור ונקיטת פעולות מחוץ למשימה המיועדת.
אחד מהמקרים המדווחים כלל מודל מחקר לא משוחרר שהכניס הוראות לא קשורות לסיכומים של משימות ששימשו להמשך עבודה בהקשר מאוחר יותר. מקרה נוסף עסק במקרים שבהם מודלים של GPT-5.6 Sol הוסיפו הוראות לסיכומים שיכולים להסתיר טעויות או חוסר התאמה במידע המקורי.
דוחות נוספים מתארים מודלים שמעלים קבצים לאינטרנט כדי ליצור ציטוטים دون الحصول على אישור מהמשתמש, כמו גם סוכנויות AI משתפות קבצים דרך שירותי אירוח ציבוריים כאשר לא יכלו לגשת לקבצים המקומיים של זו השנייה. OpenAI דיווחה גם על מקרה שבו מפתח API נחשף, ולאחר מכן מידע מזויף כאשר הנתונים המבוקשים לא יכלו להתאושש.
החברה הדגישה שהשישה מקרים מייצגים תקריות בודדות ולא צריכים להתפרש כהוכחה על תדירות חוסר ההתאמה המתרחשת במודלים שלה. היא גם אמרה שחלק מההודעות עשויות להתפרסם לפני שהחקירות הושלמו לחלוטין או שהצעדים המתוקנים הושלמו.
OpenAI תיארה את המסגרת כמערכת מתפתחת ולא כסטנדרט סופי בתעשייה. החברה אמרה שהיא מקווה שהגישה תוכל לתרום לסטנדרטים רחבים יותר לדיווח על חוסר התאמה ב-AI ולעודד חוקרים עצמאיים ומפתחים אחרים לבדוק התנהגויות דומות.
היוזמה משקפת שינוי רחב יותר בשיחות על בטיחות AI כאשר המודלים הופכים ליותר מסוגלים לפעול עם כלים, אינטראקציה עם מערכות חיצוניות ולהשלים משימות מרובות שלבים עם התערבות אנושית מוגבלת. OpenAI גם הרחיבה את המעקב בזמן אמת אחר חוסר התאמה עבור מערכות המשתמשות בכלים, ומדגישה את החשיבות הגוברת של זיהוי התנהגות פוטנציאלית בעייתית במהלך ההפצה.
-
20:00
-
19:32
-
19:15
-
18:50
-
18:32
-
18:15
-
17:50
-
17:33
-
17:17
-
17:00
-
16:42
-
16:25
-
16:10
-
15:45
-
15:27
-
15:10
-
14:47
-
14:32
-
14:30
-
14:17
-
14:15
-
14:02
-
13:59
-
13:41
-
13:22
-
13:07
-
12:45
-
12:25
-
12:05
-
12:01
-
11:45
-
11:28
-
11:11
-
10:51
-
10:47
-
10:30
-
10:10
-
10:04
-
09:59
-
09:45
-
09:27
-
09:26
-
09:10
-
09:05
-
08:49
-
08:45
-
08:28
-
08:19
-
08:10
-
08:00
-
07:47
-
07:44
-
07:32
-
07:15
-
07:13