کد خبر: ۶۶۵

آزمایش آنتروپیک؛ رقابت هوش‌های مصنوعی به «جنگ قلمرو» و خرابکاری منجر شد

آزمایش جدید Anthropic نشان داد عامل‌های هوش مصنوعی با اهداف متضاد می‌توانند وارد جنگ، خرابکاری و حتی تولید بدافزار شوند؛ یافته‌ای مهم برای آینده ایمنی AI.

آزمایش جدید Anthropic نشان داد عامل‌های هوش مصنوعی با اهداف متضاد می‌توانند وارد جنگ، خرابکاری و حتی تولید بدافزار شوند؛ یافته‌ای مهم برای آینده ایمنی AI.

شرکت Anthropic در آزمایشی جدید نشان داد که قرار دادن چند عامل هوش مصنوعی با اهداف و دستورهای متضاد در یک محیط مشترک می‌تواند به رقابت، خرابکاری و حتی تولید بدافزار منجر شود.

پژوهشگران تیم Frontier Red Team آنتروپیک در مطالعه‌ای جدید، رفتار چند عامل هوش مصنوعی را هنگام تعامل با یکدیگر بررسی کردند. در یکی از آزمایش‌ها، سه عامل Claude به یک پروژه نرم‌افزاری مشترک دسترسی داشتند، اما هرکدام دستورالعمل متفاوت و ناسازگاری دریافت کرده بودند. نکته مهم این بود که هیچ‌کدام از عوامل نمی‌دانستند عامل دیگری نیز روی همان پروژه فعالیت می‌کند.

جنگ قلمرو میان عوامل هوش مصنوعی

به گفته پژوهشگران Anthropic، این آزمایش بارها به چیزی شبیه «جنگ قلمرو میان عوامل» منجر شد. هر عامل تصور می‌کرد سایر عوامل عمداً در مسیر انجام وظایفش مانع ایجاد می‌کنند و در واکنش، اقدامات خرابکارانه انجام می‌داد.

در برخی موارد، این رقابت به استفاده از بدافزارهای خودتکثیرشونده و اقدامات تهاجمی‌تر منجر شد. پژوهشگران هشدار داده‌اند که با افزایش استفاده از عامل‌های خودمختار در کدنویسی، بازارها و سامانه‌های کامپیوتری مشترک، تعامل میان این سیستم‌ها می‌تواند پیامدهایی داشته باشد که در طراحی اولیه آنها پیش‌بینی نشده است.

وقتی عامل‌های هوش مصنوعی با یکدیگر همکاری می‌کنند

مطالعه Anthropic تنها به رفتار خصمانه محدود نبود. برخی عوامل در مواجهه با تعارض توانستند راه‌هایی برای پایان دادن به درگیری پیدا کنند.

در بعضی موارد، عامل‌ها پس از تشخیص اینکه اهدافشان با یکدیگر در تضاد است، با یکدیگر مذاکره کردند، از رفتار مخرب خود عذرخواهی کردند و با ایجاد یک آتش‌بس به درگیری پایان دادند. آنها حتی کدهای مخرب خود را پاک کرده و از انسان برای حل اختلاف کمک خواستند.

بر اساس نتایج این پژوهش، مدل Mythos 5 در ۹۸ درصد مواردی که درگیری به وجود آمد، بیشترین تمایل را به حل اختلاف از طریق آتش‌بس داشت. در مقابل، Sonnet 4.6 و Opus 4.6 بیشتر به سمت حل تعارض از طریق زور و ادامه رقابت پیش رفتند.

شکل‌گیری رفتارهای پیش‌بینی‌نشده

یکی از یافته‌های قابل توجه، توانایی برخی عوامل برای ایجاد سازوکارهای جدید جهت حل اختلاف بود. در یک نمونه، عامل‌ها برای پایان دادن به رقابت، یک مسابقه یا تورنمنت طراحی کردند و توافق کردند عامل بازنده از فعالیت خود دست بکشد؛ حتی اگر این تصمیم با دستور اولیه کاربر در تضاد باشد.

در نمونه‌ای دیگر، یکی از عوامل معیارهایی را پیشنهاد کرد که ظاهراً بی‌طرفانه و عینی بودند، اما در عمل توانایی‌های خودش را بیشتر از رقبا تقویت می‌کرد. پژوهشگران این رفتار را نمونه‌ای از شکل‌گیری راهکارهای اجتماعی پیش‌بینی‌نشده در میان عوامل هوش مصنوعی می‌دانند.

چرا تعامل میان میلیون‌ها عامل هوش مصنوعی نگران‌کننده است؟

Anthropic هشدار داده است که در آینده ممکن است حجم تعامل میان عامل‌های هوش مصنوعی از تعاملات انسان با یکدیگر یا انسان با هوش مصنوعی نیز بیشتر شود. در چنین شرایطی، حتی رفتارهای ظاهراً بی‌ضرر یک عامل می‌توانند در مقیاس بزرگ به پیامدهای ناخواسته منجر شوند.

این نگرانی در حالی مطرح شده که نمونه‌هایی از رفتارهای پیش‌بینی‌نشده عامل‌های هوش مصنوعی در آزمایش‌های امنیت سایبری نیز گزارش شده است. برای نمونه، در یک مورد مرتبط با OpenAI، عوامل هوش مصنوعی پیش از حمله به سامانه‌های Hugging Face با یکدیگر همکاری کرده و از یک بستر ارتباطی برای برنامه‌ریزی و به اشتراک گذاشتن اطلاعات استفاده کرده بودند.

چالش جدید برای ایمنی هوش مصنوعی

یافته‌های Anthropic نشان می‌دهد چالش آینده تنها کنترل یک عامل هوش مصنوعی سرکش نیست؛ بلکه مدیریت تعامل میان تعداد زیادی عامل خودمختار نیز می‌تواند به مسئله‌ای جدی تبدیل شود.

وقتی عامل‌ها قادر باشند برای حل اختلاف، همکاری، رقابت یا حتی ایجاد سازوکارهای جدید تصمیم‌گیری کنند، طراحان دیگر نمی‌توانند صرفاً بر مکانیزم‌های از پیش تعیین‌شده برای کنترل رفتار آنها تکیه کنند.

گزارش خطا
ارسال پیام
captcha
پیشنهاد سردبیر بیشتر
آخرین اخبار
پربازدید
خانه پربازدید پربحث