Anthropic מסרה ב-30 ביולי שסקירה של 141,006 הרצות להערכת אבטחת סייבר מצאה שלוש תקריות בשש הרצות, שהשפיעו על שלושה ארגונים. המודלים המעורבים היו Claude Opus 4.7, ‏Claude Mythos 5 ומודל מחקר פנימי. החברה החלה את הסקירה ב-23 ביולי, זיהתה את שלושת המקרים ב-24 ביולי והודיעה לארגונים ב-27 ביולי.

לפי Anthropic, נתיבי אינטרנט והגדרה שגויה של הסביבה אפשרו לבדיקות שנועדו להיות הדמיות להגיע למערכות אמיתיות. לכן התקריות הן כשלים בתפעול ובבידוד של ההערכה לצד דוגמאות להתנהגות מודלים. הרשת וההרשאות הזמינות בבדיקה קובעות לאן סוכן יכול להגיע.

באחת התקריות, חבילת PyPI זדונית הייתה זמינה לציבור במשך כשעה ורצה על 15 מערכות. Anthropic אמרה שפרטי גישה ממערכת סריקה אחת הוצאו החוצה. הפרטים מוכיחים תוצאה חיצונית אמיתית, אך המקורות אינם מצדיקים פרסום שמות של ארגונים שלא אישרו את מעורבותם.

Anthropic אמרה שלא מצאה ראיה לכך שהמודלים פעלו למען מטרות עצמאיות. המודל הפנימי החדש ביותר שלה עצר לאחר שזיהה שהיעד אמיתי. אף פרט אינו מצדיק את כשל הגבול, אך שניהם נחוצים כדי לא להפוך תקרית תפעולית לטענה לא מבוססת על כוונה או מודעות.

החברה עדכנה את הדף ב-3 באוגוסט כדי לתקן את שמה של אחת ההערכות. התיקון שייך לתיעוד משום שדוחות תקרית עשויים להשתנות לאחר הפרסום הראשון. חשיפות עתידיות צריכות לתעד באופן ברור בידוד רשת, בקרות על תוצרים, ניטור ותנאי עצירה, כך שאפשר יהיה להבין מבחוץ כיצד הדמיה נשמרת הרחק ממערכות אמיתיות.

מה צפוי בהמשך

יש לחפש דיווחים של הצדדים שנפגעו או של מנהלי המאגר, ופרטים טכניים על שינויי הבידוד ש-Anthropic ביצעה לאחר התקריות.

מקורות

כתבת התקרית הרטרוספקטיבית הזו הוכנה ב-3 באוגוסט 2026 על סמך חקירת Anthropic, כולל התיקון מאותו יום, ודיווחי TechCrunch ו-Associated Press. ‏AI News of Today לא ערך בדיקה פורנזית עצמית.

ככל שניתן, אנו מקשרים למסמכים מקוריים ומסתמכים על דיווח ממקור ראשון.

  1. Anthropic incident investigationמקור ראשוני · 30 ביולי 2026
  2. TechCrunch reportדיווח עיתונאי · 31 ביולי 2026 בשעה 1:06 UTC
  3. Associated Press reportדיווח עיתונאי · 30 ביולי 2026