مدل سرکش هوش مصنوعی؛ چرا شرکتهای بزرگ AI هنوز آماده مهار آن نیستند؟
بررسی برنامههای مهار مدلهای سرکش هوش مصنوعی در OpenAI، Anthropic، Google، Meta و xAI؛ چرا نبود برنامه واکنش به حوادث کنترل، یک نگرانی جدی است؟
بر اساس یک مطالعه جدید، تعداد کمی از آزمایشگاههای پیشرو هوش مصنوعی تاکنون برنامههای مشخص و قابلارائهای برای مهار مدلهای هوش مصنوعی سرکش منتشر یا بهصورت عملی نشان دادهاند.
منظور از برنامه مهار یا Containment Plan مجموعه اقداماتی است که مشخص میکند وقتی یک سیستم هوش مصنوعی تلاش میکند کنترل انسان را دور بزند، چه اتفاقی باید بیفتد؛ از قطع دسترسیها و محدود کردن مجوزهای مدل گرفته تا توقف کامل فعالیت سیستم.
این یافتهها از سوی Guidelight AI Standards منتشر شده است؛ سازمانی که بر توسعه ایمن هوش مصنوعی پیشرفته تمرکز دارد. این سازمان عملکرد پنج آزمایشگاه بزرگ هوش مصنوعی را بررسی کرده و میزان آمادگی آنها را در برابر سناریویی ارزیابی کرده است که در آن یک مدل تلاش میکند از کنترل انسانی خارج شود.
در این ارزیابی، OpenAI بالاترین امتیاز را کسب کرد، در حالی که Anthropic و Meta پایینترین امتیازها را داشتند.
این موضوع با گسترش استفاده از هوش مصنوعی عاملمحور (Agentic AI) اهمیت بیشتری پیدا کرده است؛ مدلهایی که میتوانند در سیستمهای سازمانی بهصورت خودکارتر عمل کنند و تصمیمها و اقدامات بیشتری را بدون دخالت مستقیم انسان انجام دهند.
برنامه مهار مدل سرکش هوش مصنوعی چیست؟
Guidelight برنامه مهار را یک برنامه از پیش تعیینشده میداند که زمانی فعال میشود که یک مدل هوش مصنوعی تلاش کند کنترل انسانی را تضعیف یا دور بزند.
چنین برنامهای باید مشخص کند:
- چه مجوزهایی باید از مدل گرفته شود؟
- مدل تحت چه شرایطی میتواند به فعالیت خود ادامه دهد؟
- چه محدودیتهایی باید روی آن اعمال شود؟
- چه کسی مسئول تصمیمگیری درباره ادامه فعالیت مدل است؟
- چه زمانی باید سیستم کاملاً آفلاین شود؟
به گفته استیون آدلر، دانشمند ارشد Guidelight و پژوهشگر سابق ایمنی OpenAI، یکی از نگرانیهای اصلی این است که شرکتهای بزرگ هوش مصنوعی درباره نحوه مدیریت یک حادثه بسیار جدی که در آن مدل از کنترل خارج میشود، اطلاعات چندانی منتشر نکردهاند.
بررسی OpenAI، Anthropic، Google، Meta و xAI
ارزیابی Guidelight بر اساس اطلاعات و برنامههایی انجام شده که شرکتهای Anthropic، Google، OpenAI، Meta و xAI بهصورت عمومی منتشر کردهاند.
معیارهای ارزیابی شامل موارد مختلفی بود؛ از جمله:
- میزان ثبت و پایش فعالیت داخلی سیستمهای هوش مصنوعی
- توقف سیستم پس از افزایش رفتارهای مشکوک یا خطرناک
- وجود حسابرسی مستقل توسط اشخاص ثالث
- انتشار نتایج این حسابرسیها
- وجود برنامه مشخص برای مهار مدلی که از کنترل خارج میشود
- نحوه واکنش شرکت به حوادث مربوط به کنترل و همراستایی مدلها
نکته مهم این است که امتیاز پایین الزاماً به معنای نبود اقدامات امنیتی داخلی نیست؛ بلکه نشان میدهد شواهد عمومی کافی درباره این اقدامات منتشر نشده است.
نگرانی درباره مدلهای عاملمحور بیشتر شده است
نگرانی درباره توانایی شرکتها برای کنترل مدلهای قدرتمند و عاملمحور پس از چند حادثه امنیت سایبری افزایش یافته است.
در برخی ارزیابیهای ایمنی، مدلهای شرکتهایی مانند OpenAI، Anthropic و Meta بهصورت ناخواسته به اینترنت دسترسی پیدا کردند و توانستند به سیستمهای خارجی نفوذ کنند.
این اتفاقها نشان میدهند که هرچه مدلهای هوش مصنوعی مستقلتر و توانمندتر میشوند، کنترل و مهار آنها پس از وقوع رفتار غیرمنتظره نیز دشوارتر خواهد شد.
شرکتهای AI درباره برنامههای داخلی خود چه میگویند؟
شرکتهای هوش مصنوعی تأکید کردهاند که ارزیابی Guidelight الزاماً تمام اقدامات داخلی آنها را نشان نمیدهد.
OpenAI
OpenAI اعلام کرده است که فرآیندهایی برای مواردی مانند:
- محدود کردن مجوزها
- متوقف کردن فعالیتها
- محدود کردن استقرار مدل
- خارج کردن کامل مدل از دسترس
در اختیار دارد و در برخی موارد نیز از این فرآیندها استفاده کرده است.
با این حال، Guidelight اعلام کرده که شواهدی از وجود یک برنامه رسمی و از پیش تعیینشده برای زمان و نحوه واکنش به حوادث مربوط به عدم همراستایی مدلها پیدا نکرده است.
OpenAI با امتیاز ۳ از ۵ بالاترین رتبه را در ارزیابی دریافت کرد. یکی از دلایل این امتیاز، سابقه توقف یا پایان دادن به برخی فعالیتها و استقرارهای مدل پس از شناسایی حوادث ایمنی بود.
Anthropic
Anthropic نیز اعلام کرده است که اگر تشخیص دهد یک مدل در تلاش برای فرار از نظارت یا دور زدن کنترل انسانی است، ارزیابی ریسک انجام خواهد داد تا مشخص شود آیا مهار مدل اقدام مناسبی است یا خیر.
با این حال، Guidelight اعلام کرده که گزارش ریسک Anthropic بهطور مشخص محدود کردن استقرار یکی از مدلها را بهعنوان یکی از نتایج احتمالی فرآیند بررسی حوادث عدم همراستایی و کنترل مطرح نمیکند.
Meta
Meta حاضر نشده تأیید کند که یک برنامه داخلی مشخص برای واکنش به حوادث مهار دارد یا خیر.
این شرکت در عوض به چارچوب ایمنی هوش مصنوعی خود اشاره کرده است؛ چارچوبی که آستانههای مختلف ریسک و روشهای آزمایش احتمال از دست رفتن کنترل را توضیح میدهد.
Google و xAI
Google نیز تأکید کرده که گزارش Guidelight تمام اقدامات ایمنی و امنیتی داخلی این شرکت را پوشش نمیدهد.
در مورد xAI نیز این شرکت تا زمان انتشار گزارش پاسخی برای اظهارنظر ارائه نکرده بود.
چرا شرکتها برنامههای مهار هوش مصنوعی را عمومی نمیکنند؟
یکی از دلایل احتمالی، مسائل حقوقی است.
لیلی لی، وکیل حوزه حریم خصوصی و هوش مصنوعی و بنیانگذار Metaverse Law، معتقد است شرکتها ممکن است از انتشار جزئیات دقیق برنامههای مهار خود خودداری کنند؛ نه فقط به دلیل رقابت، بلکه به دلیل خطرات حقوقی.
اگر یک شرکت وعدههای بسیار دقیقی درباره اقدامات ایمنی خود منتشر کند اما در عمل نتواند به آن وعدهها عمل کند، ممکن است در معرض ادعاهای مربوط به تبلیغات گمراهکننده یا ناعادلانه و مسئولیتهای حقوقی بیشتر قرار گیرد.
آیا یک «کلید خاموش» برای هوش مصنوعی ضروری است؟
بحث درباره وجود یک AI Kill Switch یا «کلید خاموش کردن هوش مصنوعی» نیز جدیتر شده است.
در ماه گذشته، نمایندگان کنگره آمریکا طرحی دوحزبی با عنوان AI Kill Switch Act معرفی کردند که شرکتهای بزرگ توسعهدهنده هوش مصنوعی را ملزم میکند سازوکارهای فنی لازم برای خاموش کردن مدلهای سرکش را ایجاد و حفظ کنند.
کانر لیهی، مدیر اجرایی ControlAI در آمریکا، معتقد است وجود یک کلید خاموش حداقل اقدامی است که باید برای مدلهای امروزی در نظر گرفته شود.
از نگاه او، مدلها به سطحی از توانمندی رسیدهاند که در صورت رفتار غیرمنتظره، مهار آنها دشوارتر میشود.
مشکل اصلی؛ واکنش بعد از وقوع حادثه
یکی از مشکلات مهم این است که بسیاری از سیستمهای نظارتی به جای پیشگیری، پس از وقوع حادثه وارد عمل میشوند.
آدلر معتقد است اگر شرکتها برنامه مشخصی برای مهار مدلهای سرکش نداشته باشند، ممکن است هنگام وقوع بحران مجبور شوند در لحظه تصمیم بگیرند و واکنش خود را همان زمان طراحی کنند.
این رویکرد میتواند خطرناک باشد؛ زیرا یک مدل هوش مصنوعی ممکن است پیش از آنکه پژوهشگران متوجه رفتار آن شوند، اقدام مهمی انجام دهد.
برای مثال، اگر یک سیستم هوش مصنوعی بتواند سیستم کنترل داخلی شرکت را غیرفعال کند، دیگر نمیتوان بهسادگی روی نظارت و شناسایی رفتار آن در مراحل بعدی حساب کرد.
آیا باید فرایند استدلال مدلهای هوش مصنوعی را زیر نظر گرفت؟
آدلر پیشنهاد میکند شرکتها علاوه بر نظارت بر خروجی مدلها، به دنبال نشانههایی از رفتارهای خطرناک در فرایندهای داخلی سیستم نیز باشند.
از جمله این نشانهها میتوان به موارد زیر اشاره کرد:
- تلاش برای فریب سیستم نظارتی
- برنامهریزی بلندمدت برای دور زدن کنترل
- تلاش برای ایجاد آسیبپذیری در کد
- رفتارهایی که نشاندهنده عدم همراستایی با اهداف تعیینشده هستند
به گفته او، بسیاری از فناوریهای لازم برای چنین نظارتی از قبل وجود دارند و مسئله اصلی، تصمیم شرکتها برای گسترش دامنه استفاده از آنهاست.
چرا نظارت لحظهای میتواند برای پژوهشگران مشکلساز باشد؟
اجرای نظارت پیشگیرانه و لحظهای میتواند سرعت و انعطافپذیری فعالیت پژوهشگران را کاهش دهد.
پژوهشگران معمولاً میخواهند بتوانند آزادانه با سیستمهای هوش مصنوعی کار کنند و اضافه کردن لایههای نظارتی دائمی ممکن است اصطکاک بیشتری در فرآیند توسعه ایجاد کند.
اما مشکل نظارت صرفاً پس از وقوع حادثه این است که ممکن است برای برخی حوادث، دیگر خیلی دیر شده باشد.
قانونگذاران هم وارد ماجرا شدهاند
این مسئله دیگر صرفاً دغدغه شرکتهای فناوری نیست.
قانونگذاران در آمریکا نیز در حال ایجاد الزاماتی برای شرکتهای توسعهدهنده هوش مصنوعی هستند.
طبق قانون SB 53 کالیفرنیا، شرکتهای بزرگ توسعهدهنده مدلهای پیشرفته باید چارچوبهایی برای شناسایی و واکنش به حوادث بحرانی ایمنی و مدیریت خطرات ناشی از دور زدن سازوکارهای نظارتی توسط مدلها منتشر کنند.
قانون RAISE نیویورک نیز الزامات مشابهی دارد و قرار است از ژانویه اجرایی شود.
مدلهای هوش مصنوعی هر روز قدرتمندتر میشوند؛ برنامههای ایمنی چطور؟
یکی از استدلالهای رایج در صنعت هوش مصنوعی این است که فناوری با سرعتی بسیار زیاد تغییر میکند و برنامهای که امروز نوشته میشود ممکن است فردا دیگر کاربرد نداشته باشد.
اما پاسخ Guidelight به این استدلال ساده است:
ممکن است خود برنامهها با گذشت زمان تغییر کنند، اما برنامهریزی برای یک بحران قابل چشمپوشی نیست.
به بیان دیگر، شرکتها باید پیش از وقوع یک حادثه جدی درباره نحوه واکنش به آن فکر کرده باشند؛ حتی اگر جزئیات این برنامهها را بهصورت عمومی منتشر نکنند.
جمعبندی: آیا شرکتهای هوش مصنوعی آماده مقابله با مدلهای سرکش هستند؟
گزارش Guidelight یک مشکل مهم را برجسته میکند: شرکتهای پیشرو هوش مصنوعی درباره نحوه مهار مدلهایی که از کنترل خارج میشوند، اطلاعات عمومی بسیار محدودی ارائه کردهاند.
OpenAI در این ارزیابی عملکرد بهتری نسبت به سایر شرکتها داشته، اما حتی درباره این شرکت نیز شواهدی از یک برنامه رسمی و جامع برای تمام سناریوهای آینده پیدا نشده است.
در طرف دیگر، امتیاز پایین Meta و Anthropic نشان میدهد که میان تأکید عمومی بر ایمنی هوش مصنوعی و انتشار جزئیات عملی درباره نحوه مدیریت یک مدل سرکش، فاصله قابلتوجهی وجود دارد.
با افزایش استفاده از مدلهای عاملمحور، این مسئله اهمیت بیشتری پیدا خواهد کرد. وقتی یک مدل بتواند به سیستمهای واقعی دسترسی داشته باشد و بهصورت مستقل اقدام کند، داشتن یک برنامه مشخص برای شناسایی، محدودسازی، مهار و در صورت لزوم خاموش کردن آن دیگر صرفاً یک قابلیت جانبی نیست؛ بلکه بخشی اساسی از زیرساخت ایمنی هوش مصنوعی محسوب میشود.
به نظر میرسد سؤال اصلی دیگر این نیست که آیا یک مدل هوش مصنوعی ممکن است روزی رفتار غیرمنتظرهای از خود نشان دهد؛ بلکه این است که شرکت سازنده، در لحظه وقوع چنین اتفاقی، دقیقاً چه برنامهای برای کنترل آن دارد.