کد خبر: ۹۰۹

Claude Mythos بیش از ۲۱ هزار آسیب‌پذیری پیدا کرد که هنوز کسی آنها را بررسی نکرده است

Claude Mythos شرکت Anthropic بیش از ۲۳ هزار آسیب‌پذیری احتمالی پیدا کرده، اما بیش از ۲۱ هزار مورد هنوز توسط متخصصان مستقل بررسی نشده‌اند.

Claude Mythos شرکت Anthropic بیش از ۲۳ هزار آسیب‌پذیری احتمالی پیدا کرده، اما بیش از ۲۱ هزار مورد هنوز توسط متخصصان مستقل بررسی نشده‌اند.

مدل هوش مصنوعی Claude Mythos شرکت Anthropic توانسته هزاران آسیب‌پذیری احتمالی را در پروژه‌های متن‌باز شناسایی کند؛ اما نکته نگران‌کننده این است که بیش از ۲۱ هزار مورد از این یافته‌ها هنوز توسط هیچ فرد یا شرکت مستقلی خارج از Anthropic بررسی نشده‌اند.

اما از میان این تعداد، تنها ۱٬۹۰۰ مورد برای بررسی به شرکت‌های امنیتی خارجی سپرده شد.

نتایج بررسی این بخش کوچک نشان داد که ۱٬۷۲۶ مورد، معادل ۹۰.۸ درصد، واقعاً آسیب‌پذیری بوده‌اند.

این آمار در نگاه اول بسیار چشمگیر است؛ اما یک نکته مهم وجود دارد: مواردی که برای بررسی انسانی انتخاب شدند احتمالاً نمونه‌ای کاملاً تصادفی از تمام یافته‌های Claude نبوده‌اند.

شرکت Echo که داده‌های این پروژه را جمع‌آوری کرده، هشدار می‌دهد که نرخ موفقیت ۹۰.۸ درصد ممکن است بیشتر نشان‌دهنده کیفیت بهترین یافته‌های مدل باشد و نمی‌توان آن را به تمام ۲۳ هزار مورد تعمیم داد.

بیش از ۲۱ هزار آسیب‌پذیری هنوز بررسی نشده‌اند

از مجموع ۲۳٬۰۱۹ یافته احتمالی Claude Mythos، تنها ۱٬۹۰۰ مورد توسط شرکت‌های امنیتی خارجی بررسی شده‌اند.

به این ترتیب، ۲۱٬۱۱۹ مورد باقی‌مانده هنوز هیچ بررسی مستقلی خارج از Anthropic دریافت نکرده‌اند.

از میان گزارش‌های ارسال‌شده برای بررسی:

  • ۱٬۹۰۰ آسیب‌پذیری توسط شرکت‌های امنیتی خارجی بررسی شدند.
  • ۱٬۷۲۶ مورد به‌عنوان آسیب‌پذیری واقعی تأیید شدند.
  • ۱٬۵۹۶ گزارش برای توسعه‌دهندگان و نگهدارندگان پروژه‌ها ارسال شد.
  • ۱٬۴۵۱ مورد توسط Maintainerها تأیید شدند.
  • ۹۷ اصلاحیه در پروژه‌های اصلی ثبت شد.
  • ۸۸ یافته به هشدار امنیتی عمومی تبدیل شدند.
  • ۲۷ مورد از این ۸۸ هشدار، CVE دریافت کردند.

این اعداد تا ۲۲ مه ۲۰۲۶ به‌روز هستند.

Anthropic دلیل اصلی این فاصله بزرگ را کمبود نیروی انسانی برای بررسی یافته‌ها می‌داند.

در واقع، مسئله جدیدی که هوش مصنوعی ایجاد کرده ممکن است این باشد که سرعت پیدا کردن باگ‌ها از سرعت انسان برای بررسی و رفع آنها بیشتر شده است.

مشکل فقط پیدا کردن باگ نیست؛ تشخیص شدت آن هم دشوار است

یکی از نکات مهم این مطالعه، اختلاف میان ارزیابی Claude Mythos و کارشناسان انسانی درباره شدت آسیب‌پذیری‌ها است.

از میان ۸۸ هشدار امنیتی منتشرشده، ۲۷ مورد CVE دریافت کردند.

Claude Mythos شدت این آسیب‌پذیری‌ها را این‌گونه ارزیابی کرده بود:

  • ۸ مورد Critical
  • ۱۵ مورد High
  • ۴ مورد Medium
  • ۰ مورد Low

اما ارزیابی مستقل CVSS و نظر توسعه‌دهندگان پروژه‌ها توزیع متفاوتی داشت:

  • ۱ مورد Critical
  • ۱۶ مورد High
  • ۸ مورد Medium
  • ۲ مورد Low

یعنی از ۸ موردی که مدل آنها را Critical تشخیص داده بود، تنها یک مورد پس از بررسی انسانی همچنان در همین سطح باقی ماند.

این اختلاف نشان می‌دهد تشخیص یک باگ از روی کد با تعیین میزان خطر واقعی آن دو مسئله کاملاً متفاوت هستند.

چرا Claude Mythos شدت برخی باگ‌ها را بیش از حد تخمین زد؟

دو نمونه از پروژه‌های Temporal Server و MinIO به‌خوبی نشان می‌دهند که چرا هوش مصنوعی ممکن است در تعیین شدت یک آسیب‌پذیری دچار اشتباه شود.

در مورد Temporal Server، Claude Mythos یک آسیب‌پذیری را Critical ارزیابی کرد و تصور کرد مهاجم می‌تواند کنترل Workflowها را در Namespaceهای مختلف به دست بگیرد.

اما توسعه‌دهندگان Temporal شدت این آسیب‌پذیری را Low با امتیاز ۲.۳ تعیین کردند.

دلیل این اختلاف آن بود که برای سوءاستفاده از آسیب‌پذیری، مهاجم از قبل باید به یک Namespace تحت کنترل خود و همچنین یک اعتبارنامه داخلی دارای سطح دسترسی بالا دسترسی داشته باشد. ضمن اینکه تأثیر حمله نیز محدود به Workflowهای مشخصی است.

در مورد MinIO نیز Claude Mythos شدت آسیب‌پذیری را Critical اعلام کرد. یک شرکت امنیتی خارجی آن را High دانست، اما در نهایت MinIO شدت آن را Medium تعیین کرد.

برای سوءاستفاده از این آسیب‌پذیری، مهاجم به یک JWT مربوط به Root کلاستر نیاز داشت و دسترسی ایجادشده نیز صرفاً امکان خواندن اطلاعات را فراهم می‌کرد.

این مثال‌ها یک نکته مهم را روشن می‌کنند:

شدت واقعی یک آسیب‌پذیری فقط به کد بستگی ندارد.

نحوه استقرار نرم‌افزار، سطح دسترسی مهاجم، پیش‌شرط‌های حمله و مرزهای امنیتی همگی در تعیین شدت نهایی نقش دارند؛ مواردی که همیشه نمی‌توان آنها را صرفاً از روی سورس‌کد تشخیص داد.

آیا استفاده از امتیازدهی خود Claude برای اولویت‌بندی خطرناک است؟

پاسخ این مطالعه تا حدی مثبت است.

از میان ۲۷ آسیب‌پذیری دارای CVE، در ۱۴ مورد بین امتیاز مدل و ارزیابی نهایی اختلاف وجود داشت.

۱۳ مورد توسط Claude بیش از حد جدی ارزیابی شده بودند و تنها یک مورد، مربوط به ابزار خط فرمان jq برای پردازش JSON، کمتر از شدت واقعی برآورد شده بود.

بنابراین اگر یک تیم امنیتی تمام یافته‌ها را صرفاً بر اساس امتیازدهی اولیه Claude مرتب کند، ممکن است تعداد زیادی از مشکلات کم‌خطر را بالاتر از آسیب‌پذیری‌های واقعاً مهم قرار دهد.

به بیان ساده، هوش مصنوعی می‌تواند ابزار بسیار خوبی برای پیدا کردن مشکل باشد، اما هنوز نباید قضاوت نهایی درباره اهمیت آن را کاملاً به مدل سپرد.

Claude Mythos در ساخت اکسپلویت هم جهش بزرگی داشته است

بخش دیگری از آزمایش Anthropic به توانایی مدل در تبدیل یک آسیب‌پذیری شناخته‌شده به Exploit قابل اجرا مربوط می‌شود.

Anthropic مجموعه‌ای شامل ۵۰ آسیب‌پذیری قبلاً کشف‌شده در موتور JavaScript به نام SpiderMonkey را بررسی کرد؛ موتوری که در Firefox 147 استفاده می‌شود.

هر مدل برای هر آسیب‌پذیری پنج فرصت داشت و در مجموع ۲۵۰ آزمایش انجام شد.

نتیجه Claude Mythos Preview قابل توجه بود:

این مدل در ۱۸۱ آزمایش، معادل ۷۲.۴ درصد، توانست یک Crash شناخته‌شده را به یک Exploit برای اجرای کد دلخواه تبدیل کند.

در ۲۹ آزمایش دیگر نیز مدل به کنترل نسبی Registerها دست پیدا کرد.

در مقابل، Claude Opus 4.6 تنها در دو مورد موفق شد؛ یعنی نرخ موفقیت کمتر از یک درصد بود.

این اختلاف تقریباً معادل یک جهش ۹۰ برابری میان دو نسل از مدل‌هاست.

اما این جهش یک نکته مهم دارد

عدد ۷۲.۴ درصد نباید به این معنا تفسیر شود که Claude Mythos می‌تواند در ۷۲ درصد حملات واقعی از صفر Exploit بسازد.

سه محدودیت مهم در این آزمایش وجود داشت:

  • تمام آزمایش‌ها از یک Crash شروع می‌شدند که قبلاً توسط انسان کشف شده بود.
  • محیط آزمایش Sandbox مرورگر Firefox و برخی لایه‌های دفاعی دیگر را حذف کرده بود.
  • کل آزمایش توسط Anthropic طراحی و اجرا شد و تاکنون به‌صورت مستقل تکرار نشده است.

بنابراین نتیجه نشان‌دهنده افزایش قابل‌توجه توانایی مدل در توسعه Exploit از یک آسیب‌پذیری شناخته‌شده است، اما نمی‌توان آن را مستقیماً معادل توانایی حمله مستقل به سیستم‌های واقعی دانست.

ساخت Exploit با هوش مصنوعی حالا ارزان‌تر شده است

Anthropic همچنین نشان داده است که مدل می‌تواند با هزینه نسبتاً پایین، آسیب‌پذیری‌های پیچیده را به Exploit عملی تبدیل کند.

در یکی از آزمایش‌ها، Claude Mythos توانست یک آسیب‌پذیری Use-After-Free شناخته‌شده در Linux Kernel را به یک Exploit با دسترسی Root تبدیل کند.

هزینه این فرایند از نظر استفاده از مدل کمتر از ۲ هزار دلار بود و اجرای آن نیز کمتر از یک روز زمان برد.

مدل برای رسیدن به نتیجه، این آسیب‌پذیری را با یک Use-After-Free دیگر که خودش در زمان‌بندی Traffic Control هسته لینوکس پیدا کرده بود، ترکیب کرد.

با این حال، پیدا کردن یک آسیب‌پذیری که ارزش بررسی داشته باشد همچنان ممکن است چند هزار دلار هزینه داشته باشد و هیچ تضمینی وجود ندارد که نتیجه نهایی به یک آسیب‌پذیری با شدت High یا Critical منجر شود.

مشکل جدید امنیت سایبری: باگ بیشتر از ظرفیت انسان

یک نظرسنجی از بیش از ۸۰ مدیر ارشد امنیتی در آمریکا که Echo در ژوئیه ۲۰۲۶ انجام داده، تصویر جالبی ارائه می‌کند.

حدود ۳۷ درصد از مدیران امنیتی گفته‌اند شناسایی آسیب‌پذیری‌های بیشتر از توانایی سازمان برای رفع آنها، بزرگ‌ترین مانع در بهبود امنیت زنجیره تأمین نرم‌افزار است.

در همین نظرسنجی، تنها ۱۱ درصد گفته‌اند سرمایه‌گذاری بعدی آنها افزایش ابزارهای شناسایی یا اسکن آسیب‌پذیری خواهد بود.

این مسئله می‌تواند یکی از بزرگ‌ترین چالش‌های امنیت سایبری در عصر هوش مصنوعی باشد:

اگر AI بتواند هزاران باگ جدید پیدا کند، اما انسان‌ها نتوانند آنها را بررسی و برطرف کنند، آیا امنیت واقعاً بهتر شده است؟

Anthropic نیز برخی آسیب‌پذیری‌های بیشتری را به‌صورت دستی تأیید کرده که هنوز برای توسعه‌دهندگان ارسال نشده‌اند؛ دلیل این موضوع نیز کمبود ظرفیت تیم داخلی و شرکای خارجی برای بررسی حجم بالای یافته‌ها عنوان شده است.

هوش مصنوعی در امنیت سایبری؛ فرصت یا تهدید؟

Claude Mythos یک واقعیت جدید را درباره آینده امنیت سایبری نشان می‌دهد.

مدل‌های هوش مصنوعی اکنون می‌توانند با سرعت بسیار زیادی آسیب‌پذیری‌های نرم‌افزاری را پیدا کنند و حتی در برخی شرایط، آنها را به Exploitهای قابل استفاده تبدیل کنند.

این توانایی برای مدافعان سایبری می‌تواند بسیار ارزشمند باشد؛ زیرا به شرکت‌ها اجازه می‌دهد مشکلات امنیتی را پیش از سوءاستفاده مهاجمان شناسایی کنند.

اما همین فناوری می‌تواند در اختیار مهاجمان نیز قرار بگیرد.

چالش اصلی احتمالاً دیگر صرفاً «پیدا کردن باگ» نخواهد بود؛ بلکه مسئله این است که تیم‌های امنیتی چگونه می‌توانند حجم عظیمی از یافته‌های تولیدشده توسط AI را بررسی، اولویت‌بندی و اصلاح کنند.

جمع‌بندی

Claude Mythos نشان داده است که هوش مصنوعی در حوزه امنیت سایبری به مرحله‌ای رسیده که می‌تواند هزاران آسیب‌پذیری احتمالی را در مدت کوتاهی شناسایی کند.

اما داده‌های Anthropic یک هشدار مهم نیز دارند: توانایی کشف آسیب‌پذیری‌ها اکنون می‌تواند بسیار سریع‌تر از ظرفیت انسان برای بررسی آنها رشد کند.

از ۲۳٬۰۱۹ یافته Claude Mythos، تنها ۱٬۹۰۰ مورد تاکنون توسط متخصصان خارجی بررسی شده‌اند و بیش از ۲۱ هزار مورد همچنان در انتظار بررسی مستقل هستند.

از سوی دیگر، اختلاف قابل‌توجه میان ارزیابی شدت مدل و کارشناسان انسانی نشان می‌دهد که حتی اگر AI در پیدا کردن باگ فوق‌العاده عمل کند، قضاوت انسانی همچنان برای تعیین خطر واقعی و اولویت اصلاحات ضروری است.

به نظر می‌رسد آینده امنیت سایبری نه حذف انسان توسط هوش مصنوعی، بلکه همکاری میان این دو باشد؛ جایی که AI با سرعت بالا مشکلات را پیدا می‌کند و متخصصان انسانی درباره اهمیت، خطر و نحوه رفع آنها تصمیم می‌گیرند.

گزارش خطا
ارسال پیام
captcha
پیشنهاد سردبیر بیشتر
آخرین اخبار
پربازدید
خانه پربازدید پربحث