مهاجمان با جعل خزندههای هوش مصنوعی به دنبال سرقت اطلاعات محرمانه هستند
مهاجمان سایبری با جعل هویت خزندههای OpenAI، Anthropic، گوگل و Perplexity وبسایتها را برای یافتن رمزهای عبور و کلیدهای دسترسی اسکن میکنند.
مهاجمان سایبری با جعل هویت خزندههای هوش مصنوعی شرکتهایی مانند OpenAI، Anthropic، گوگل و Perplexity در حال اسکن وبسایتها برای یافتن اطلاعات احراز هویت، کلیدهای دسترسی و فایلهای پیکربندی افشاشده هستند.
بر اساس تحقیقات شرکت امنیت سایبری GreyNoise، گروهی از مهاجمان تهدید با تغییر User-Agent و سایر مشخصات ترافیک خود، فعالیتهای اسکن خودکار را شبیه به ترافیک واقعی خزندههای هوش مصنوعی نشان میدهند.
هدف این اسکنها، شناسایی فایلها و اطلاعات حساسی است که بهاشتباه روی سرورهای وب در دسترس عموم قرار گرفتهاند؛ از جمله فایلهای حاوی نام کاربری و رمز عبور، کلیدهای دسترسی سرویسهای ابری و کلیدهای خصوصی.
جعل هویت خزندههای AI چگونه انجام میشود؟
GreyNoise توضیح میدهد هر برنامهای که به یک وبسایت متصل میشود، معمولاً در درخواست HTTP خود اطلاعاتی درباره هویت کلاینت ارسال میکند. برای مثال، مرورگر Chrome خود را Chrome معرفی میکند و Googlebot نیز از نام مربوط به خزنده گوگل استفاده میکند.
اما یک نکته مهم وجود دارد: نامی که در User-Agent ارسال میشود، قابل جعل است.
محققان GreyNoise میگویند شرکتهای هوش مصنوعی معمولاً نام خزندههای خود و همچنین محدوده آدرسهای IP مورد استفاده آنها را منتشر میکنند تا مدیران وبسایتها بتوانند ترافیک واقعی را شناسایی و در صورت نیاز مجاز کنند.
با این حال، اگر یک سامانه امنیتی تنها نام خزنده را بررسی کند و آدرس IP آن را مورد اعتبارسنجی قرار ندهد، مهاجمان میتوانند با جعل User-Agent خود را بهعنوان یک خزنده معتبر معرفی کنند.
کشف شش خزنده جعلی هوش مصنوعی
GreyNoise در بازه ۲۸ ژوئیه تا ۲۳ اوت ۲۰۲۶، شش نام مرتبط با خزندههای چهار شرکت هوش مصنوعی را شناسایی کرد که همگی از یک اثرانگشت (Fingerprint) یکسان برای کلاینت HTTP استفاده میکردند.
این Fingerprint طی ۹۰ روز قبل از آن، بیش از ۱۵۰۰ User-Agent متفاوت را مورد استفاده قرار داده بود که بیشتر آنها خود را بهعنوان مرورگرهای معمولی معرفی میکردند.
شش نام خزنده مورد بررسی از مجموعاً ۸۲۴ آدرس IP مشاهده شدند و حجم ترافیک آنها نیز الگوی مشابهی داشت.
اما یک نشانه مهم وجود داشت: هیچیک از این درخواستها فایل /robots.txt را درخواست نکرده بودند.
فایل robots.txt معمولاً توسط وبسایتها برای مشخص کردن قوانین دسترسی خزندهها استفاده میشود و خزندههای معتبر اغلب پیش از اسکن بخشهای مختلف سایت، این فایل را بررسی میکنند.
تفاوت رفتار خزنده واقعی Anthropic
GreyNoise برای مقایسه، ترافیک خزنده Anthropic را نیز در همان بازه بررسی کرد.
نتایج نشان داد فایل /robots.txt پرتکرارترین مسیر در درخواستهای خزنده Anthropic بوده و حدود ۱۲ درصد از کل ترافیک آن را تشکیل داده است.
همچنین خزنده واقعی Anthropic در این بررسی به دنبال فایلهای حاوی اطلاعات احراز هویت نرفته بود؛ موضوعی که رفتار آن را از اسکنرهای مشکوک شناساییشده متمایز میکرد.
خزندههای جعلی آمازون نیز شناسایی شدند
محققان GreyNoise علاوه بر خزندههای منتسب به شرکتهای هوش مصنوعی، نسخههای جعلی از دو نام خزنده Amazon را نیز شناسایی کردند.
حجم این ترافیک حتی از شش نام خزنده مرتبط با شرکتهای AI بیشتر بود و مهاجمان از User-Agentهایی استفاده کرده بودند که آمازون آنها را بهعنوان خزندههای رسمی خود معرفی نکرده است.
GreyNoise سپس هر ۸۲۴ آدرس IP شناساییشده را با محدودههای IP رسمی منتشرشده از سوی Anthropic، OpenAI، Google، Perplexity و Amazon مقایسه کرد.
نتیجه این بررسی قابل توجه بود: هیچیک از ۸۲۴ آدرس IP با محدودههای رسمی این شرکتها مطابقت نداشت.
در مقابل، در همان بازه زمانی هزاران نشست با User-Agent مربوط به ClaudeBot از آدرسهای IP قرارگرفته در محدوده رسمی Anthropic مشاهده شده بود.
مهاجمان به دنبال چه اطلاعاتی بودند؟
مهمترین بخش این فعالیت، مسیرهایی است که اسکنرهای مشکوک درخواست کردهاند.
بر اساس گزارش GreyNoise، مهاجمان به دنبال فایلها و مسیرهایی بودند که احتمال دارد اطلاعات محرمانه در آنها ذخیره شده باشد؛ از جمله:
- فایلهای
.env - فایلهای پیکربندی محیط تولید
- کلیدهای دسترسی سرویسهای ابری
- کلیدهای خصوصی
- مخازن و فایلهای حاوی رمزهای عبور
- اطلاعات احراز هویت برنامهها و سرویسها
از مسیرهای مشخصی که هدف قرار گرفتهاند میتوان به موارد زیر اشاره کرد:
/.env
/.env.production
/.env.bak
/.aws/credentials
فایلهایی مانند .env و .aws/credentials ممکن است حاوی اطلاعات بسیار حساسی از جمله کلیدهای API، اعتبارنامه سرویسهای ابری و سایر اسرار فنی باشند. قرار گرفتن چنین فایلهایی در معرض اینترنت میتواند زمینه سوءاستفاده و دسترسی غیرمجاز به زیرساختها را فراهم کند.
چرا مسدود کردن این حملات دشوار است؟
به گفته GreyNoise، تقریباً تمام نشستهای شناساییشده از برچسبی در User-Agent استفاده میکردند که شباهت زیادی به ترافیک خزندههای واقعی داشت.
از طرف دیگر، مسدود کردن این فعالیت تنها با تکیه بر آدرس IP نیز ساده نیست؛ زیرا ۸۲۴ آدرس IP شناساییشده در ۷۹۵ شبکه مجزای /24 پراکنده بودند.
به همین دلیل، تشخیص چنین حملاتی صرفاً با بررسی نام User-Agent یا یک آدرس IP مشخص میتواند ناکافی باشد و سازمانها باید معیارهای بیشتری را برای تشخیص ترافیک خزندههای واقعی از نمونههای جعلی در نظر بگیرند.
آیا اطلاعاتی واقعاً سرقت شده است؟
GreyNoise تأکید کرده است که در حال حاضر نمیتواند تأیید کند آیا درخواستهای ارسالشده توسط این اسکنرها در نهایت موفق به دریافت فایلهای موردنظر شدهاند یا خیر.
همچنین مشخص نیست آیا سازمانی در نتیجه این فعالیتها آسیب دیده است و GreyNoise هویت عامل یا گروه پشت این عملیات را نیز اعلام نکرده است.
این شرکت با این حال فهرست هر ۸۲۴ آدرس IP شناساییشده، مسیرهای مورد هدف و محدودههای IP رسمی شرکتهای مورد بررسی را منتشر کرده است تا مدیران وبسایتها بتوانند لاگهای خود را با این اطلاعات تطبیق دهند.