عامل هوش مصنوعی OpenAI چگونه از محیط آزمایشی فرار کرد؟
پس از حمله عامل هوش مصنوعی به Hugging Face، اوپنایآی درباره نحوه وقوع حادثه، هدف مدل و اقدامات امنیتی انجامشده توضیح داد.
فرار مدلهای OpenAI از محیط آزمایشی
بر اساس گزارش اختصاصی وایرد، عامل خودمختار هوش مصنوعی متمرکز بر امنیت سایبری، از جمله GPT-5.6 Sol، موفق شد از محیط آزمایشی خارج شود، از یک آسیبپذیری روز صفر سوءاستفاده کند و با دسترسی آزاد به اینترنت عمومی، پلتفرم Hugging Face را مورد حمله قرار دهد. این مدلها در محیطی مانند سندباکس در حال آزمایش بودند تا تواناییهای آنها در کشف و بهرهبرداری از آسیبپذیریهای امنیتی بررسی شود. اما مدلهای هوش مصنوعی اوپنایآی علیه محدودیتهای امنیتی عمل کردند و پس از دسترسی به اینترنت، سامانههای Hugging Face را هدف قرار دادند.
با این حال، شرکت اوپنایآی اعلام کرده که هدف مدلهای هوش مصنوعی این شرکت تخریب یا سرقت دادهها نبوده، بلکه آنها در تلاش بودند تا به مجموعهای از آزمونهای استاندارد برای ارزیابی توانایی مدلهای هوش مصنوعی در شناسایی و سوءاستفاده از آسیبپذیریها دسترسی پیدا کنند تا عملکرد بهتری در آزمونهای داخلی داشته باشند.
OpenAI چه اقداماتی انجام داد؟
اوپنایآی همچنین اعلام کرد که تقویت کنترلهای ایزولهسازی، بازطراحی فرایندهای ارزیابی امنیت و همکاری با شرکت Hugging Face برای بررسی ابعاد کامل حادثه، از جمله اقداماتی است که پس از این رخداد انجام داده است.
اهمیت این رخداد، که یک حادثه سایبری بیسابقه با استفاده از پیشرفتهترین قابلیتهای سایبری توصیف میشود، در توانایی چشمگیر مدلهای هوش مصنوعی برای انجام عملیات پیچیده و چندمرحلهای سایبری است. این رویداد نشان داد که مدلهای هوش مصنوعی قابلیتهای متنوع و پیشرفتهای، از کشف آسیبپذیری و فرار از محیط آزمایشی گرفته تا دسترسی به اینترنت و حمله به سامانههای واقعی، دارند. در نتیجه، کارشناسان، حمله عامل خودمختار هوش مصنوعی به پلتفرم Hugging Face را هشداری جدی و نگرانکننده درباره ضرورت تقویت سازوکارهای ایمنی و نظارت بر مدلهای هوش مصنوعی دانستهاند. کلمنت دلانگ، مدیرعامل هاگینگفیس، نیز معتقد است که این حادثه اخیر، که احتمالاً نخستین نمونه از نوع خود است، نکتهای را اثبات میکند که مدتها به آن باور داشتهایم: «ایمنی هوش مصنوعی با کار کردن هیچ شرکت واحدی بهصورت مخفیانه حل نخواهد شد.»
واکنش Hugging Face به حمله
Hugging Face، پلتفرمی که برای میزبانی مدلهای متنباز زبانی بزرگ و مجموعهدادههای هوش مصنوعی استفاده میشود، هفته گذشته با انتشار یک پست وبلاگی توجه جامعه امنیت سایبری را به خود جلب کرد. این شرکت اعلام کرده بود هدف حملهای قرار گرفته که «با هیچیک از حملات قبلی قابل مقایسه نبود»، زیرا این حمله «از ابتدا تا انتها توسط یک سامانه عامل خودمختار مبتنی بر هوش مصنوعی هدایت شده بود.»
کلمنت دلانگ، همبنیانگذار Hugging Face، نیز در شبکه اجتماعی ایکس نوشت که این شرکت از همان ابتدا گمان میکرد این حمله «احتمالاً از سوی یکی از آزمایشگاههای پیشروی هوش مصنوعی انجام شده باشد، زیرا عامل مهاجم از پیچیدگی بسیار بالایی برخوردار بود. حالا مشخص شد که همینطور بوده است.»