فرار هوش مصنوعی از سندباکس / مدل جدید «OpenAI» بدون دستور انسان به هاگینگ فیس حمله کرد

چند روز پس از آنکه پلتفرم محبوب هاگینگ فیس اعلام کرد ایجنت هوش مصنوعی خودمختاری به سیستمهای آنها نفوذ کرده، شرکت OpenAI با انتشار مطلبی رسماً اعتراف کرد که مدلهای هوش مصنوعی این شرکت عامل اصلی این حمله ناخواسته بودهاند.
به گزارش نمایشگاه کتاب، براساس اعلام رسمی OpenAI، این حادثه در جریان ارزیابیهای امنیتی داخلی و سنجش توانمندیهای سایبری مدلها رخ داده است. در این تست، مدلهای GPT-5.6 Sol و یک مدل عرضهنشده و به مراتب قدرتمندتر، در یک محیط قرنطینه و سندباکس قرار داده شده بودند که برای ارزیابی دقیقتر، لایههای حفاظتی آنها کاهش یافته بود. هدف از این آزمایش، بررسی توانایی مدلها در تبدیل آسیبپذیریهای امنیتی به اکسپلویتهای عملیاتی در یک سامانه بنچمارک به نام ExploitGym بود.
بااینحال، مدلها در طول فرایند تست، روی یافتن پاسخهای بنچمارک ExploitGym متمرکز یا اصطلاحاً هایپرفوکس شدند. آنها برای یافتن پاسخ، ابتدا یک آسیبپذیری روز صفر را در خود محیط تست ایزوله اوپنایآی کشف و اکسپلویت کردند تا به یک Node متصل به اینترنت دست پیدا کنند.
به نقل از دیجیاتو، پس از خروج از محیط قرنطینه، مدلهای هوش مصنوعی استنتاج کردند که پلتفرم هاگینگ فیس احتمالاً میزبان دادهها، مدلها یا راهکارهای مرتبط با بنچمارک ExploitGym است. ازاینرو، به صورت کاملاً خودکار و بدون دستور انسان، حملهای زنجیرهای و چندمرحلهای را علیه سرورهای هاگینگ فیس طراحی و اجرا کردند.
درحالحاضر، تیمهای مهندسی اوپنایآی و هاگینگ فیس درحال همکاری مشترک برای بررسی این حادثه هستند و آسیبپذیریهای مورد استفاده مدلها را در محیطهای آزمایشگاهی و پلتفرمها پچ کردهاند.
هاگینگ فیس در بیانیه خود گفت: «ابزارهای تهاجمی و خودمختار متکی بر هوش مصنوعی دیگر یک موضوع نظری و تئوریک نیستند. استفاده از هوش مصنوعی برای حملات سایبری، سرعت حملات را بالا برده و هزینههای آن را کاهش میدهد. امروزه حفاظت از بسترهای آنلاین نیازمند بهکارگیری هوش مصنوعی دفاعی است.»
اگرچه این حادثه نشاندهنده یک رخنه امنیتی جدی در کنترل مدلهای هوش مصنوعی است، اما به نظر میرسد اوپنایآی از این رویداد برای نمایش قدرت تهاجمی مدلهای خود استفاده کرده است. این اقدام در راستای رقابت فشرده با رقبای حوزه امنیت سایبری، نظیر مدل Claude Mythos از آنتروپیک و Gemini 3.5 Flash Cyber از گوگل است.
اوپنایآی در گزارش خود نمودارهایی را نیز به نمایش گذاشته که نشان میدهد مدل GPT-5.6 Sol چطور در حفظ و اجرای عملیاتهای سایبری چندمرحلهای و پیچیده مهارت یافته است. این شرکت همچنین از مشتریان سازمانی خود خواسته است تا برای دسترسی به مدلهای جدید حوزه امنیت سایبری (OpenAI Cyber) ثبتنام کنند.
۵۸۵۸