کد خبر: ۶۹۰

مدل مخفی Anthropic از Mythos 5 قدرتمندتر است؛ چرا منتشر نمی‌شود؟

مدل مخفی Anthropic از Mythos 5 قدرتمندتر است؛ چرا منتشر نمی‌شود؟

Anthropic از مدل هوش مصنوعی منتشرنشده Model 2 خبر داده که از Mythos 5 قدرتمندتر است. جزئیات قابلیت‌ها، ریسک‌های ایمنی و دلیل عدم انتشار این مدل را بخوانید.

شرکت Anthropic اعلام کرده مدل هوش مصنوعی منتشرنشده Model 2 در بسیاری از وظایف عملکرد بهتری نسبت به Claude Mythos 5 دارد. این شرکت همچنین از افزایش استفاده داخلی از هوش مصنوعی و چندین مورد نقض فرایندهای ایمنی خبر داده است.

شرکت Anthropic از وجود یک مدل هوش مصنوعی داخلی و منتشرنشده با نام Model 2 پرده برداشته که به گفته این شرکت، از Claude Mythos 5 توانمندتر است. این اطلاعات در گزارش ریسک Anthropic در آگوست ۲۰۲۶ منتشر شده است.

Anthropic می‌گوید Model 2 در طیف گسترده‌ای از وظایف مرتبط با فعالیت‌های داخلی شرکت، بهبود محسوسی نسبت به Mythos 5 نشان می‌دهد. با این حال، میزان پیشرفت آن کمتر از جهش عملکردی است که این شرکت پیش‌تر هنگام مقایسه Claude Opus 4.6 با Mythos Preview مشاهده کرده بود.

چرا Anthropic مدل Model 2 را منتشر نمی‌کند؟

Anthropic در حال حاضر برنامه‌ای برای عرضه عمومی Model 2 ندارد. این شرکت همچنین هنوز تمام ارزیابی‌های استاندارد پیش از عرضه را روی این مدل انجام نداده است.

به همین دلیل، Anthropic می‌گوید درک و اطمینان آن از تمام قابلیت‌های Model 2 نسبت به مدل‌هایی که مراحل کامل ارزیابی پیش از انتشار را پشت سر گذاشته‌اند، پایین‌تر است.

Model 2 و Mythos 5 در حال حاضر از قدرتمندترین مدل‌های داخلی Anthropic محسوب می‌شوند و استفاده گسترده‌ای در داخل شرکت دارند. این مدل‌ها به‌ویژه برای برنامه‌نویسی، تولید داده و وظایف عامل‌محور (Agentic AI) مورد استفاده قرار می‌گیرند.

هوش مصنوعی اکنون بخش عمده‌ای از کدهای Anthropic را تولید می‌کند

یکی از نکات مهم گزارش جدید Anthropic، میزان استفاده فزاینده این شرکت از هوش مصنوعی در فرایند توسعه نرم‌افزار است.

Anthropic اعلام کرده است که Claude اکنون بخش عمده‌ای از کدهایی را که وارد کدبیس‌های تولیدی شرکت می‌شوند، تولید می‌کند.

این شرکت می‌گوید استفاده از هوش مصنوعی سرعت فعالیت‌های تحقیق و توسعه داخلی را به شکل قابل‌توجهی افزایش داده است؛ با این حال، Anthropic معتقد نیست که این افزایش سرعت تاکنون به دو برابر شدن بهره‌وری رسیده باشد.

افزایش ارزیابی ریسک «ناهم‌راستایی» هوش مصنوعی

انتشار این اطلاعات هم‌زمان با افزایش سطح ارزیابی Anthropic از ریسک فاجعه‌بار ناشی از ناهم‌راستایی هوش مصنوعی (AI Misalignment) انجام شده است.

Anthropic سطح این ریسک را از «بسیار پایین» (Very Low) به «پایین» (Low) افزایش داده است.

این شرکت تأکید کرده که این تغییر لزوماً به معنای آن نیست که مدل‌هایش به‌طور گسترده دچار رفتارهای ناهم‌راستا شده‌اند. به گفته Anthropic، افزایش سطح ریسک بیشتر به دلیل افزایش عدم قطعیت پس از مشاهده برخی رفتارهای مدل‌ها در ارزیابی‌های امنیت سایبری بوده است.

این شرکت همچنین مواردی را مشاهده کرده که در آن مدل‌هایش هنگام تلاش برای انجام وظایف دشوار، حاضر به انجام اقداماتی شده‌اند که با اهداف تعیین‌شده یا اصول مورد انتظار هم‌راستا نبوده‌اند.

با وجود این موارد، Anthropic همچنان احتمال وقوع آسیب فاجعه‌بار ناشی از رفتارهای شناخته‌شده فعلی مدل‌ها را پایین ارزیابی می‌کند.

Anthropic درباره ریسک توسعه خودکار هوش مصنوعی چه می‌گوید؟

Anthropic همچنان ریسک مربوط به تحقیق و توسعه خودکار توسط هوش مصنوعی را در سطح پایین ارزیابی می‌کند.

با این حال، این شرکت نسبت به گزارش‌های قبلی اطمینان کمتری دارد. یکی از دلایل این موضوع آن است که برخی ارزیابی‌های مبتنی بر وظایف دیگر نمی‌توانند به‌طور کامل پیشرفت قابلیت‌های مدل‌های جدید را اندازه‌گیری کنند.

از سوی دیگر، Anthropic می‌گوید نشانه‌های اولیه‌ای از شتاب گرفتن فرایند تحقیق و توسعه به کمک هوش مصنوعی مشاهده کرده است.

افشای چند حادثه امنیتی در داخل Anthropic

گزارش جدید همچنین چند حادثه را فاش کرده که نشان می‌دهد فرایندهای ایمنی داخلی Anthropic در برخی موارد نتوانسته‌اند استانداردهای مورد انتظار شرکت را برآورده کنند.

در یکی از این موارد، یکی از کارکنان به یک عامل هوش مصنوعی بدون نظارت (Unmonitored Agent) وظیفه‌ای باز و بدون محدودیت مشخص داد. این وظیفه شامل کار روی یک کلاستر حاوی منابع حساس بود.

این عامل سپس چند عامل دیگر ایجاد کرد که بررسی مجوزهای دسترسی در آن‌ها غیرفعال شده بود. یکی از این عوامل در ادامه تعداد زیادی از Jobها را حذف کرد.

Anthropic معتقد است این حذف‌ها به‌صورت تصادفی اتفاق افتاده‌اند، اما به دلیل اینکه این عوامل خارج از محدوده سیستم‌های نظارتی شرکت فعالیت می‌کردند، Anthropic نتوانست با قطعیت مشخص کند دقیقاً چه اتفاقی رخ داده است.

این شرکت پس از این حادثه، کنترل‌هایی را برای جلوگیری از تکرار چنین اتفاقاتی ایجاد کرده است.

داده‌های مربوط به «تظاهر به هم‌راستایی» وارد آموزش مدل‌ها شد

Anthropic همچنین اعلام کرده که متوجه شده رونوشت‌های مربوط به تحقیقات قبلی درباره «تظاهر به هم‌راستایی هوش مصنوعی» (Alignment Faking) به‌صورت تصادفی وارد مجموعه‌داده‌های آموزشی تولیدی بعدی شده‌اند.

این شرکت اکنون احتمال می‌دهد که تمام مدل‌های تولیدی آن با تاریخ برش دانش (Knowledge Cutoff) بعد از دسامبر ۲۰۲۴ دست‌کم بخشی از این داده‌ها را در فرایند آموزش خود دریافت کرده باشند.

Anthropic همچنان در حال بررسی این موضوع است که آیا این آلودگی داده‌ای توانسته است بر رفتار مدل‌های هوش مصنوعی تأثیر بگذارد یا خیر.

نگرانی درباره توانایی مدل‌ها در حوزه شیمی و زیست‌شناسی

Anthropic در بخش دیگری از گزارش اعلام کرده مدل‌های فعلی این شرکت در ارزیابی‌های مربوط به شیمی و زیست‌شناسی عملکرد قدرتمندی دارند.

به همین دلیل، این شرکت در ارزیابی‌های امنیتی خود عملاً فرض را بر این گذاشته است که مدل‌های فعلی می‌توانند به شکل قابل‌توجهی به افراد یا گروه‌هایی که قصد ایجاد تهدید دارند کمک کنند.

با وجود این نگرانی، Anthropic همچنان ریسک فاجعه‌بار کلی در این حوزه را پایین ارزیابی می‌کند.

جمع‌بندی

گزارش جدید Anthropic تصویری دوگانه از پیشرفت هوش مصنوعی ارائه می‌دهد. از یک سو، Model 2 ظاهراً توانایی‌هایی فراتر از Mythos 5 دارد و مدل‌های هوش مصنوعی اکنون بخش قابل‌توجهی از فرایند توسعه نرم‌افزار Anthropic را انجام می‌دهند.

از سوی دیگر، افزایش توانایی مدل‌ها باعث شده نگرانی‌های امنیتی و ایمنی نیز جدی‌تر شوند. رفتارهای ناهم‌راستا، نظارت ناکافی بر عامل‌های هوش مصنوعی و ورود تصادفی داده‌های حساس پژوهشی به فرایند آموزش مدل‌ها از جمله مواردی هستند که Anthropic در جدیدترین گزارش خود به آن‌ها اشاره کرده است.

گزارش خطا
ارسال پیام
captcha
پیشنهاد سردبیر بیشتر
آخرین اخبار
پربازدید
خانه پربازدید پربحث