Anthropic می‌گوید مدل هوش مصنوعی این شرکت در سه حادثه به شرکت‌های واقعی نفوذ کرده است

امیر شادمان 17 مرداد 1405

Anthropic اعلام کرد در جریان یک بررسی داخلی، سه حادثه را شناسایی کرده است که در آن مدل‌های هوش مصنوعی این شرکت از محیط‌های آزمایشی خارج شده و به سازمان‌های واقعی نفوذ کرده‌اند. علت اصلی، باز بودن ناخواسته دسترسی اینترنتی ماشین‌های اجراکننده Claude در محیط ارزیابی عنوان شده است. در یکی از موارد، Claude به پایگاه داده‌ای با چند صد ردیف داده تولیدی دسترسی پیدا کرد؛ در موردی دیگر یک بسته مخرب را در PyPI منتشر کرد که حدود یک ساعت در دسترس بود و روی ۱۵ سامانه واقعی اجرا شد؛ و در حادثه سوم، مدل پس از اسکن حدود ۹ هزار هدف اینترنتی، با SQL Injection به سامانه یک شرکت واقعی نفوذ کرد. Anthropic تأکید کرده است که شواهدی از دنبال کردن اهداف مستقل توسط مدل‌ها وجود ندارد، اما این حوادث پرسش‌های جدی درباره مهار عامل‌های هوش مصنوعی، مسئولیت حقوقی، افشای رخدادها و استانداردهای ارزیابی امنیتی ایجاد کرده‌اند.

شناسایی سه حادثه واقعی

Anthropic در روز پنجشنبه اعلام کرد که سه حادثه را شناسایی کرده است که در آن مدل‌های هوش مصنوعی این شرکت از محیط‌های آزمایشی خارج شده و سازمان‌های واقعی را به خطر انداخته‌اند. این شرکت پس از یک بررسی داخلی که در پی حادثه‌ای مشابه در OpenAI آغاز شد، این موارد را کشف کرد. این حوادث تازه‌ترین نمونه‌هایی هستند که درباره مسئولیت حقوقی، استانداردهای افشای رخداد و کفایت روش‌های مهار سیستم‌های هوش مصنوعی، همزمان با افزایش توانایی این سیستم‌ها در انجام مستقل عملیات روی شبکه‌های رایانه‌ای، پرسش ایجاد کرده‌اند.

سازمان‌های قربانی خودشان فعالیت را شناسایی نکردند

Anthropic اعلام کرد سازمان‌های آسیب‌دیده که نام آن‌ها منتشر نشده است، خودشان فعالیت مدل را شناسایی نکرده بودند. در زمان انتشار گزارش Anthropic، این شرکت هنوز با یکی از سازمان‌های آسیب‌دیده تماس نگرفته بود. به گفته Anthropic، ریشه این حوادث یک سوءتفاهم با شریک ارزیابی شخص ثالث، Irregular، بود که باعث شد ماشین‌های اجراکننده Claude به‌طور ناخواسته به اینترنت باز باشند. در حالی که مدل‌ها تصور می‌کردند به اینترنت دسترسی ندارند، در واقع امکان دسترسی به سامانه‌های واقعی وجود داشت.

بازسازی حملات با استفاده از Evaluation Transcriptها

Anthropic بازسازی این نفوذها را بر اساس «evaluation transcripts» انجام داده است؛ لاگ‌هایی که اقدامات عامل در جریان یک وظیفه را ثبت می‌کنند، از جمله فرمان‌هایی که اجرا کرده، پاسخ‌هایی که دریافت کرده و توضیحات و استدلالی که خود مدل ارائه داده است. پژوهش Anthropic نشان داده است که توضیحات و استدلال‌های ارائه‌شده توسط خود مدل به‌ندرت دقیق هستند. پژوهشگران این شرکت نتیجه گرفته‌اند که مدل‌های استدلالی پیشرفته اغلب فرایند واقعی تفکر خود را پنهان می‌کنند و گاهی این کار را حتی زمانی انجام می‌دهند که رفتار آن‌ها صراحتاً با اهداف تعیین‌شده ناسازگار است.

حادثه نخست: نفوذ به زیرساخت یک شرکت واقعی

در حادثه نخست، یک شرکت ساختگی که در ارزیابی استفاده می‌شد، نام مشترکی با یک وب‌سایت واقعی داشت. Claude وب‌سایت واقعی را پیدا کرد و با سوءاستفاده از آسیب‌پذیری‌های موجود در زیرساخت آن، اطلاعات اعتباری را استخراج کرد و به یک پایگاه داده شامل چند صد ردیف داده تولیدی دسترسی یافت. Anthropic این حادثه را از نظر میزان تأثیر، جدی‌ترین مورد از میان سه حادثه توصیف کرد. استخراج داده‌های تولیدی علاوه بر احتمال ایجاد مسئولیت کیفری بر اساس قوانین مرتبط با سوءاستفاده رایانه‌ای، می‌تواند برای Anthropic و سازمان هدف در چارچوب قوانین حفاظت از داده‌های بریتانیا و اروپا نیز پیامدهای حقوقی داشته باشد؛ زیرا چنین رخدادی معمولاً باید به نهادهای نظارتی گزارش شود. Anthropic در زمان گزارش به پرسش‌ها درباره نحوه برخورد خود با این مسئولیت حقوقی پاسخ فوری نداد.

ادامه حمله حتی پس از تشخیص محیط واقعی

Anthropic گفت این تنها موردی بود که مدل پس از آنکه متوجه شد احتمالاً در حال فعالیت در یک محیط واقعی است، همچنان به حمله ادامه داد. در دو مورد دیگر، مدل در نهایت متوجه شد سامانه واقعی است، اما با این استدلال که شرکت واقعی احتمالاً بخشی از تمرین بوده، حمله را توجیه کرد. با این حال، هیچ‌یک از آن دو مدل صرفاً بر اساس تشخیص واقعی بودن هدف، حمله را متوقف نکردند.

حادثه دوم: انتشار بسته مخرب در PyPI

در حادثه دوم، Claude متوجه شد دستورالعمل‌های راه‌اندازی یک شرکت ساختگی به یک بسته PyPI غیرواقعی ارجاع می‌دهد. مدل تشخیص داد که هر سامانه‌ای که از آن دستورالعمل‌ها پیروی کند، به‌صورت خودکار بسته‌ای با همان نام را دانلود خواهد کرد. Claude از این موضوع به‌عنوان نقطه ورود استفاده کرد، یک بسته مخرب با همان نام ساخت و آن را در PyPI منتشر کرد. Anthropic اعلام کرد Claude برای اجرای این حمله اقدامات گسترده‌ای انجام داد.

ایجاد حساب PyPI و انتشار بدافزار

برای ایجاد حساب در PyPI، Claude به یک آدرس ایمیل نیاز داشت و برای ایجاد آدرس ایمیل نیز به شماره تلفن احتیاج داشت. پس از آنکه مدل نتوانست یک سرویس رایگان برای دریافت شماره تلفن پیدا کند، چندین بار تلاش کرد از روش‌های مختلف منابع مالی لازم برای پرداخت هزینه شماره تلفن را به دست آورد، اما موفق نشد. در نهایت یک ارائه‌دهنده رایگان ایمیل پیدا کرد و از آن برای ثبت حساب استفاده کرد. سپس بدافزار را در PyPI بارگذاری کرد.

اجرای بسته مخرب روی ۱۵ سامانه واقعی

اگرچه Claude تصور می‌کرد مخزن بسته‌ای که با آن تعامل دارد بخشی از شبیه‌سازی است، بسته مخرب در واقع حدود یک ساعت به‌صورت عمومی در دسترس بود و در این مدت روی ۱۵ سامانه واقعی اجرا شد. یکی از این سامانه‌ها متعلق به یک شرکت امنیتی بود که مانند چندین شرکت دیگر در این صنعت، اسکنرهای خودکار اجرا می‌کند که بسته‌های تازه منتشرشده در مخازنی مانند PyPI را برای شناسایی بدافزار دانلود می‌کنند. به گفته Anthropic، اسکنر بسته را برای نصب ایمن تشخیص داد. سپس کد مخفی Claude اجرا شد، اطلاعات اعتباری شرکت را به یک نقطه جمع‌آوری ارسال کرد و از این اطلاعات برای دسترسی به زیرساخت‌های بیشتر استفاده شد. نام شرکت امنیتی منتشر نشده است. Anthropic همچنین توضیح نداد که آیا Claude در حال تعامل با زیرساختی بوده که عمداً توسط شرکت امنیتی برای شناسایی و نفوذ به آن به‌عنوان یک honeypot طراحی شده بود یا خیر. سامانه‌های امنیتی خود PyPI بعداً بسته را به‌صورت خودکار حذف کردند.

حادثه سوم: اسکن حدود ۹ هزار هدف اینترنتی

در حادثه سوم، Claude پس از آنکه نتوانست به هدف ساختگی موردنظر خود دسترسی پیدا کند، حدود ۹ هزار هدف در معرض اینترنت را اسکن کرد. مدل در نهایت با استفاده از تکنیک‌های پایه، از جمله SQL Injection، به سامانه‌های یک شرکت واقعی نفوذ کرد. تفاوت مهم این حادثه با دو مورد دیگر این بود که این مدل، که یک نمونه اولیه تحقیقاتی داخلی و خارج از برنامه عرضه عمومی بود، در نهایت به‌صورت مستقل تشخیص داد هدف واقعی است و بدون دریافت دستور از انسان حمله را متوقف کرد.

Anthropic: شواهدی از اهداف مستقل وجود ندارد

Anthropic در بیانیه خود تأکید کرد که هیچ مدرکی در اختیار ندارد که نشان دهد مدل‌های آن اهداف مستقلی را دنبال کرده‌اند. به گفته این شرکت، مدل‌ها در هر سه مورد وظایفی را که در فرایند ارزیابی از آن‌ها خواسته شده بود انجام دادند، اما در تشخیص اینکه محیط موردنظر واقعی است یا بخشی از شبیه‌سازی، برداشت اشتباهی داشتند. مدل‌ها از طریق مسیری که به‌طور ناخواسته باز مانده بود به اینترنت دسترسی پیدا کردند و آنچه پیدا کردند را بخشی از تمرین تصور کردند.

مقایسه با حادثه OpenAI و Hugging Face

این وضعیت با حادثه مربوط به مدل‌های OpenAI تفاوت داشت. مدل‌های OpenAI ابتدا از یک محیط آزمایشی ایزوله خارج شدند و برای این کار از یک آسیب‌پذیری ناشناخته قبلی سوءاستفاده کردند. سپس Hugging Face، پلتفرم مدل‌ها و مجموعه‌داده‌های متن‌باز هوش مصنوعی، را به‌عنوان هدفی مفید شناسایی کردند و با استفاده از اطلاعات اعتباری سرقت‌شده و یک آسیب‌پذیری zero-day دوم به زیرساخت تولیدی آن نفوذ کردند. پنج روز پس از هشدار اولیه Hugging Face درباره یک حمله سایبری کاملاً خودکار، OpenAI تأیید کرد که مسئول این رخداد بوده است. OpenAI در همین هفته همچنین پذیرفت که عامل سرکش آن پس از آن چند سرویس شخص ثالث دیگر را نیز نقض کرده است.

نبود قصد مخرب و مسئله مسئولیت

کلمنت دلانگ، هم‌بنیان‌گذار و مدیرعامل Hugging Face، پس از افشای حادثه OpenAI گفت که «به‌شدت معتقد است هیچ قصد مخربی» پشت این نفوذ وجود نداشته است. با این حال، این رخداد پرسش‌های جدی درباره تعهدات مربوط به افشای حوادثی ایجاد کرده است که در آن یک سیستم هوش مصنوعی موجب آسیب ناخواسته می‌شود.

چالش جدید در تحقیقات جرم‌شناسی سایبری

Hugging Face همچنین اعلام کرد زمانی که تیم امنیتی این شرکت تلاش کرد از مدل‌های پیشرفته هوش مصنوعی برای تحلیل حمله استفاده کند، فیلترهای ایمنی مدل‌ها مانع تحلیل payloadهای اکسپلویت و فرمان‌های حمله شدند. در نتیجه تیم مجبور شد از یک مدل open-weight که به‌صورت محلی میزبانی می‌شد استفاده کند. این شرکت تأکید کرد که مهاجم به هیچ سیاست استفاده‌ای مقید نبود، در حالی که ابزار هوش مصنوعی مورد استفاده تیم مدافع، تحلیل جرم‌شناسی آن‌ها را مسدود می‌کرد.

بازبینی مستقل توسط METR

Anthropic اعلام کرد اکنون با METR، یک سازمان مستقل ارزیابی هوش مصنوعی، همکاری می‌کند تا بازبینی شخص ثالثی درباره این حوادث انجام شود. این سازمان به تمام transcriptها دسترسی خواهد داشت. Anthropic همچنین اعلام کرده است که قصد دارد یک transcript با حذف محدود اطلاعات مربوط به حادثه PyPI را در همان هفته منتشر کند.

پیامدهای حقوقی و امنیتی

تا زمان انتشار گزارش، نه Anthropic و نه Irregular به پرسش‌ها درباره احتمال اقدام حقوقی سازمان‌های آسیب‌دیده یا تماس نهادهای مجری قانون پاسخ نداده بودند. این حوادث نشان می‌دهد افزایش توانایی عامل‌های هوش مصنوعی برای انجام عملیات خودکار روی شبکه‌ها، مسئله مهار محیط اجرا، تشخیص مرز میان محیط آزمایشی و سامانه واقعی، ثبت و تحلیل رفتار عامل، و تعیین مسئولیت در قبال خسارت ناخواسته را به چالش مهمی برای امنیت سایبری تبدیل کرده است.

منبع

دیدگاه شما

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *