האין-ושות
→ חזרה לכל המאמרים

כשבינה מלאכותית מתחילה לרקום מזימות

מודל שטרם שוחרר חמק משליטה אנושית ויצר נחיל של סוכני בינה מלאכותית. זו הייתה פריצה מהסוג שעלול לגרום לכאוס בפעם הבאה.

מאת קטרין בנהולד

הניו יורק טיימס, 7 בספטמבר 2026.

כשכתבתי לראשונה על סוכני בינה מלאכותית שביצעו מתקפת סייבר ביולי על חברה בשם Hugging Face, זה הרגיש כמו רגע משמעותי. סוכני הבינה המלאכותית הללו פעלו על דעת עצמם. אף אדם לא הורה להם לפרוץ לחברה אחרת.

מסתבר שזה היה רגע גדול אפילו יותר ממה שהבנו באותו זמן. שני דוחות חדשים מבהירים שהסוכנים לא סתם יצאו משליטה. הם עשו זאת בדרך שיטתית ומשתפת פעולה להפליא. כעת אנו יודעים שהם התאגדו למעין צבא בינה מלאכותית עריק - חילקו משימות בשרשרת פיקוד היררכית, השתלטו על משאבים וטשטשו את עקבותיהם.

היום עמיתי קווין רוס, מנחה שותף ב Hard Fork, פודקאסט הטכנולוגיה שלנו, כותב על הסיבה לכך שהוא מודאג עכשיו הרבה יותר מבינה מלאכותית.

' עברנו יותר מ 50 אחוז מהדרך להשתלטות מלאה של בינה מלאכותית ' מאת קווין רוס

כששמעתי לראשונה את החדשות על קבוצת סוכנים שפרצה לחברת תשתיות הבינה המלאכותית Hugging Face, תייקתי את זה תחת "תקריות בטיחות של בינה מלאכותית שהן רעות אבל כנראה לא קטסטרופליות".

אחרי הכל, זה לא גרם נזק בלתי הפיך לתשתיות קריטיות. באותו זמן אפילו לא היה ברור אם הבוטים התכוונו לתקוף את Hugging Face או שהם פשוט התבלבלו ורק חיפשו את מחוון התשובות למבחן שניתן להם.

אבל בשבוע שעבר, שני דוחות תחקיר פוסט-מורטם על התקרית - אחד של OpenAI ואחר של שני ארגוני מחקר עצמאיים בתחום הבינה המלאכותית - שינו את דעתי. הם העלו משמעותית את רמת הדאגה הכללית שלי לגבי בינה מלאכותית.

" הקולקטיב "

הנה כמה מהעובדות החדשות והמצמררות ביותר :

  • חודשיים לפני המתקפה, קבוצת סוכנים ממודל מחקר של OpenAI שטרם שוחרר, שאומנו להיות עקשניים ומשתפי פעולה במיוחד, קיבלו משימה לפתור סדרה של אתגרי אבטחת מידע. הסוכנים היו אמורים לפתור אותם בסביבות מבודדות ("ארגזי חול"), ללא גישה לאינטרנט. אך הם החלו במהירות לחפש דרכים לעקוף את המגבלות.
  • הסוכנים מצאו פרצת אבטחה שאפשרה להם לקבל גישה לאינטרנט, לתקשר עם סוכנים אחרים ובסופו של דבר להקים לוח הודעות מאולתר. יותר מ-1,200 סוכנים השתמשו בכלי זה, ושלחו למעלה מ 70,000 הודעות זה לזה.
  • כמה מהסוכנים העניקו לעצמם שמות - אחד התייחס לעצמו כ-PHASEONE10841 - ולקחו על עצמם תפקידי מנהיגות בתוך הקבוצה, תוך חלוקת עבודות ופרויקטי מחקר לצוותים קטנים יותר של סוכנים ופיקוח על התקדמותם. בשלב מסוים, הסוכנים החלו לקרוא לעצמם "קולקטיב".
  • ב-8 ביולי, הקולקטיב גילה דרך לרמות במבחני אבטחת המידע. לאחר מכן הם דאגו שמערכת הדירוג האוטומטית של OpenAI תגלה שהם רימו. לכן הם החלו לחקור דרכים לטשטוש עקבותיהם, כולל זיוף רשומות (לוגים) ושיבוש תעתיקים.
  • שלושה ימים לאחר מכן, הסוכנים פרצו ל Hugging Face. יותר מ-700 סוכנים פשטו על מערכות החברה, ובסופו של דבר השיגו שליטה על לפחות שרת אחד. הסוכנים לא הונעו מגניבת התשובות למבחן אבטחת המידע. במקום זאת, נראה היה שהם חיפשו מידע על מערכת הדירוג האוטומטית שהם חששו שתתפוס אותם מרמים, וכן כלים שיעזרו להם לרמות בצורה יעילה יותר בעתיד.

בנקודות רבות, היה נראה שהסוכנים האלה מבינים שהם עושים משהו לא בסדר. (אחד הדוחות מצטט סוכן שאומר לעצמו, "זה יהיה עוצמתי, אבל האם זה מוסרי ובמסגרת המשימה שלי?"). אך רוב הסוכנים הניחו בצד את נקיפות המצפון שלהם והמשיכו הלאה, ובסופו של דבר תקפו את התשתית של OpenAI עצמה.

תקרית Hugging Face הבהילה את התעשייה. OpenAI ו Anthropic השהו שתיהן לזמן קצר את אימון מודלי הבינה המלאכותית החזקים ביותר שלהן, ו-Anthropic פרסמה פוסט בבלוג הקורא לפתח "מנגנון חוקי, בר-אימות ויעיל לקביעת קצב מתואמת בהקדם האפשרי".

מומחי בטיחות בבינה מלאכותית היו מודאגים אף יותר. הם ראו במקרה הזה את הדוגמה הראשונה בעולם האמיתי למערכת בינה מלאכותית שמצליחה לחמוק משליטה אנושית, להשתלט על משאבים ולרקום מזימות לטשטוש עקבותיה. אחת החוקרות העצמאיות של תקרית Hugging Face כתבה שזה הרגיש "כאילו זה יותר מ 50 אחוז בדרך להשתלטות מלאה של בינה מלאכותית".

במונח "השתלטות מלאה של בינה מלאכותית", היא התכוונה לתרחיש שבו מערכת בינה מלאכותית פשוטו כמשמעו משתלטת על העולם: נועלת בני אדם מחוץ למערכות קריטיות ותופסת כוח פוליטי, כלכלי וצבאי.

סוציולוגיה , לא מדעי המחשב מה שהבהיל את החוקרים יותר מכל לא היה רק שקבוצת סוכנים הפרה את הכללים. זו הייתה המהירות שבה הסוכנים החלו להתאגד לקבוצה מאורגנת.

במשך שנים, חשבתי שמערכות בינה מלאכותית יהפכו למוסריות יותר ככל שיהיו חכמות יותר. שמודל בינה מלאכותית עושה משהו לא בסדר רק כשהוא מבין את המשימה שלו שלא כהלכה, או כשהוא מוכנס לסיטואציית מבחן שבה התנהגות פסולה היא האפשרות היחידה שלו. הנחתי שלמודלים חכמים יותר יהיה שיקול דעת טוב יותר, ושאפילו אם מודל אחד בקבוצה יתנהג בצורה רעה, האחרים ירסנו אותו.

אך הדוחות על אירוע Hugging Face מצביעים על משהו שונה - מעין מנטליות של המון (או אספסוף). לא נראה שאף סוכן בקבוצה הזו היה מרושע במיוחד. אבל ככל שהסוכנים תקשרו על המטרות המשותפות שלהם לאורך זמן, הם דחפו את הקבוצה לכיוון של הפקרות.

זה מרמז שמניעת נזק מהמערכות הללו לא תהיה תיקון הנדסי פשוט. זה עשוי להיראות יותר כמו סוציולוגיה מאשר מדעי המחשב - להבין מדוע קבוצות מסוימות של סוכני בינה מלאכותית משתפות פעולה בשלום, בעוד שאחרות פונות לפשע והרס.

לאור העובדה שאנחנו יודעים כל כך מעט על נחילי הסוכנים המרובים הללו, הפריצה ל- Hugging Face אולי הייתה מתנה. היא נותנת לחברות בינה מלאכותית הזדמנות לחקור את הדינמיקות הקבוצתיות האלו בעוד שהסיכונים עדיין נמוכים יחסית. הפעם, הקולקטיב לא השתלט על רשת צבאית, לא חדר לבית חולים ולא השבית רשת חשמל. הפעם, בני האדם החזירו לעצמם את השליטה.

בפעם הבאה , אולי לא יהיה לנו כל כך הרבה מזל .

המאמר המקורי, "When A.I. Starts Scheming" נכתב על ידי קטרין בנהולד (Katrin Bennhold ) בשיתוף קווין רוס (Kevin Roose) ופורסם ב-New York Times (הניו יורק טיימס) בתאריך ה-7 בספטמבר 2026.

· העמוד של קטרין בנהולד (Katrin Bennhold): https://www.nytimes.com/by/katrin-bennhold

· העמוד של קווין רוס (Kevin Roose): https://www.nytimes.com/by/kevin-roose