איור: AIOpenAI עצרה קמפיין לחילוץ חשיבה מוגנת מהמודלים שלה - ומקשרת ל-Moonshot AI
OpenAI הודיעה כי זיהתה ועצרה קמפיין מתואם שנועד לחלץ מתהליכי החשיבה המוגנים של מודלי הבינה המלאכותית שלה. לפי החברה, מדובר ב"דיסטילציה עוינת" - שימוש שיטתי ולא מורשה בפלטי מודל אחד כדי לאמן, לשחזר או לשפר מודל אחר.
מה קרה בפועל
הפעילות החלה בתחילת יולי 2026 בעצימות נמוכה, וב-24 וב-25 ביולי זינקה לכ-16 אלף בקשות עם דפוס חילוץ דומה מכיותר מ-4,000 משתמשים. בהמשך זוהו דפוסי הנחיה קשורים בקרב יותר מ-15 אלף משתמשים. לפי OpenAI, הקמפיין נעצר במלואו ב-28 ביולי.
בחברה מדגישים כי התוקפים לא פרצו הצפנה, לא חדר למסד נתונים ולא קיבלו גישה ישירה לשיחות משתמשים שמורות. במקום זאת הם תפעלו את האינטראקציה עם המודלים כך שחשיבה מוגנת שוחזרה בצורות גלויות למבקש - בניגוד לתנאי השימוש.
הקישור ל-Moonshot AI
OpenAI מייחסת את ליבת הפעילות לגורמים הקשורים ל-Moonshot AI, חברת בינה מלאכותית סינית מבייג'ינג המפתחת את מודל Kimi. החברה לא פרסמה ראיות טכניות פומביות לזיהוי, ומציינת שלא ברור אם כל המעורבים פעלו תחת גורם אחד.
OpenAI חסמה חשבונות מזויפים, פרסה הגנות נוספות, סגרה נתיב שאפשר לשחזר חשיבה מוצפנת של משתמש אחר, והוסיפה בדיקות שמזהות ועוצרות פלט שעלול לחשוף תהליך חשיבה. הממצאים הועברו גם לחברות AI אחרות דרך ה-Frontier Model Forum ולערוצי שיתוף מידע ממשלתיים.
למה זה חשוב
לדברי OpenAI, חילוץ תהליכי חשיבה עלול לאפשר לשכפל יכולות מתקדמות בלי אותה השקעה בפיתוח ובבטיחות, ובלי לשמר את מנגנוני ההגנה של המודל המקורי. החברה מזהירה מסיכוני בטיחות וביטחון לאומי, במיוחד ככל שהמודלים מתחזקים בתחומים רגישים.
הרקע להודעה הוא גם האשמות קודמות מצד Anthropic נגד מפתחות AI סיניות, בהן Moonshot AI, על שימוש סמוי במודל Claude לאימון מערכות מתחרות. מ-Moonshot AI לא התקבלה תגובה מיידית.
נא שימרו על שפה נקייה אשר מכבדת אתכם














