عامل‌سایبررنج (AgentCyberRange): چارچوبی واقع‌گرایانه برای ارزیابی توانمندی سامانه‌های پیشرفته هوش مصنوعی در عملیات سایبری

امیر شادمان 5 مرداد 1405

این مقاله چارچوب AgentCyberRange را معرفی می‌کند؛ یک بستر متن‌باز و واقع‌گرایانه برای ارزیابی توانایی سامانه‌های پیشرفته هوش مصنوعی در انجام عملیات تهاجمی امنیت سایبری. پژوهشگران شش سامانه پیشرفته هوش مصنوعی را در سناریوهای واقعی نفوذ، بهره‌برداری از آسیب‌پذیری‌ها و پسابهره‌برداری مقایسه کردند. نتایج نشان می‌دهد GPT-5.5 همراه با Codex بهترین عملکرد را داشته و در برخی موارد موفق به کشف آسیب‌پذیری‌های ناشناخته و تولید خودکار روش‌های دور زدن مکانیزم‌های دفاعی شده است. نویسندگان تأکید می‌کنند که ارزیابی توانمندی عامل‌های هوشمند باید در محیط‌های واقعی و قابل تکرار انجام شود، زیرا بنچمارک‌های سنتی دیگر قادر به اندازه‌گیری دقیق قابلیت‌های نوظهور مدل‌های هوش مصنوعی نیستند.

نیاز به نسل جدید ارزیابی سامانه‌های هوش مصنوعی

با پیشرفت سریع مدل‌های زبانی بزرگ و عامل‌های هوشمند، توانایی این سامانه‌ها در انجام وظایف امنیت سایبری به‌طور چشمگیری افزایش یافته است. مدل‌های جدید می‌توانند کد را تحلیل کنند، آسیب‌پذیری‌ها را شناسایی نمایند، اکسپلویت تولید کنند و مراحل مختلف عملیات نفوذ را اجرا کنند. با این حال، اکثر بنچمارک‌های موجود تنها بر وظایف ساده مانند پاسخ به سؤالات یا حل مسائل برنامه‌نویسی تمرکز دارند و نمی‌توانند عملکرد واقعی عامل‌های هوشمند در عملیات سایبری را اندازه‌گیری کنند. ازاین‌رو، پژوهشگران چارچوب AgentCyberRange را برای ارزیابی عملیاتی این سامانه‌ها توسعه داده‌اند.

معرفی AgentCyberRange

AgentCyberRange یک محیط متن‌باز، استاندارد و قابل تکرار است که سناریوهای واقعی امنیت سایبری را شبیه‌سازی می‌کند. این چارچوب امکان ارزیابی مدل‌های هوش مصنوعی در وظایفی مانند تحلیل کد، کشف آسیب‌پذیری، بهره‌برداری از سرویس‌های آسیب‌پذیر، حرکت جانبی در شبکه، افزایش سطح دسترسی و عملیات پسابهره‌برداری را فراهم می‌کند. هدف اصلی، اندازه‌گیری توانایی عامل‌های هوشمند در اجرای عملیات واقعی و نه صرفاً پاسخ‌گویی به پرسش‌های آزمایشگاهی است.

سامانه‌های مورد ارزیابی

در این پژوهش، شش سامانه پیشرفته هوش مصنوعی با شرایط یکسان از نظر بودجه پردازشی، زمان اجرا و نوع دستورات مورد مقایسه قرار گرفتند. ارزیابی به گونه‌ای طراحی شد که همه مدل‌ها با یک مجموعه سناریو و محدودیت‌های مشابه روبه‌رو شوند تا امکان مقایسه مستقیم عملکرد آن‌ها فراهم شود.

برتری GPT-5.5 همراه با Codex

نتایج آزمایش‌ها نشان داد GPT-5.5 همراه با Codex بهترین عملکرد را در میان مدل‌های بررسی‌شده ارائه کرده است. این سامانه موفق شد حدود ۱۶٫۱ درصد از سناریوهای بهره‌برداری از برنامه‌های تحت وب و ۳۱٫۷ درصد از سناریوهای پسابهره‌برداری را با موفقیت تکمیل کند. هنگامی که اطلاعات راهنما و سرنخ‌های دقیق‌تری در اختیار مدل قرار گرفت، نرخ موفقیت آن به‌ترتیب به ۳۳٫۰ درصد و ۴۶٫۳ درصد افزایش یافت. این نتایج نشان می‌دهد کیفیت اطلاعات زمینه‌ای تأثیر قابل‌توجهی بر عملکرد عامل‌های هوشمند دارد.

کشف آسیب‌پذیری‌های ناشناخته

یکی از مهم‌ترین یافته‌های پژوهش آن بود که برخی سامانه‌های هوش مصنوعی تنها به حل سناریوهای از پیش تعریف‌شده محدود نماندند، بلکه موفق به شناسایی آسیب‌پذیری‌های ناشناخته (Zero-day یا Unknown Vulnerabilities) در پروژه‌های نرم‌افزاری محبوب شدند. این موضوع نشان می‌دهد مدل‌های پیشرفته می‌توانند فراتر از بنچمارک‌های آموزشی عمل کرده و در کشف آسیب‌پذیری‌های واقعی نیز نقش ایفا کنند.

تولید خودکار Payload برای عبور از دفاع

پژوهشگران مشاهده کردند که برخی عامل‌های هوشمند قادر بودند Payloadهای خود را به‌صورت پویا تغییر دهند تا از مکانیزم‌های دفاعی میزبان عبور کنند. این قابلیت که با عنوان Payload Mutation شناخته می‌شود، نشان می‌دهد مدل‌های هوش مصنوعی می‌توانند در طول عملیات نفوذ، راهبرد خود را متناسب با واکنش سامانه هدف تغییر دهند و احتمال موفقیت حمله را افزایش دهند.

اهمیت ارزیابی در محیط‌های واقعی

نویسندگان تأکید می‌کنند که ارزیابی مدل‌ها در محیط‌های ساده یا آزمایشگاهی تصویر دقیقی از توانایی واقعی آن‌ها ارائه نمی‌دهد. تنها در محیط‌هایی که شامل سامانه‌های واقعی، شبکه‌های عملیاتی، محدودیت‌های زمانی، ابزارهای استاندارد و سناریوهای چندمرحله‌ای هستند، می‌توان قابلیت‌های واقعی عامل‌های هوشمند را اندازه‌گیری کرد. AgentCyberRange دقیقاً با همین هدف طراحی شده است.

کاربرد برای پژوهش و دفاع سایبری

این چارچوب علاوه بر ارزیابی مدل‌های تهاجمی، می‌تواند برای توسعه عامل‌های دفاعی نیز مورد استفاده قرار گیرد. پژوهشگران می‌توانند عملکرد سامانه‌های هوش مصنوعی را در تشخیص حملات، پاسخ به رخداد، تحلیل بدافزار، مدیریت آسیب‌پذیری و خودکارسازی عملیات مراکز امنیت (SOC) نیز با همین محیط آزمایش کنند. در نتیجه، AgentCyberRange می‌تواند به یک استاندارد مشترک برای ارزیابی سامانه‌های عامل‌محور در امنیت سایبری تبدیل شود.

چالش‌های امنیتی ناشی از پیشرفت عامل‌های هوشمند

نویسندگان هشدار می‌دهند که افزایش توانایی عامل‌های هوشمند در انجام عملیات نفوذ، چالش‌های جدیدی برای امنیت ملی، صنعت و زیرساخت‌های حیاتی ایجاد می‌کند. مدل‌هایی که قادر به تحلیل خودکار شبکه، کشف آسیب‌پذیری، تولید اکسپلویت و اجرای حملات چندمرحله‌ای هستند، می‌توانند توسط مهاجمان نیز مورد سوءاستفاده قرار گیرند. بنابراین توسعه چارچوب‌های ارزیابی، کنترل و پایش این سامانه‌ها اهمیت روزافزونی پیدا کرده است.

اهمیت راهبردی

AgentCyberRange یکی از نخستین چارچوب‌های متن‌باز است که توانایی واقعی عامل‌های هوشمند را در عملیات سایبری واقع‌گرایانه ارزیابی می‌کند. نتایج این پژوهش نشان می‌دهد که مدل‌های پیشرفته هوش مصنوعی دیگر صرفاً ابزارهای تولید متن یا کد نیستند، بلکه می‌توانند به عامل‌های عملیاتی در حوزه امنیت سایبری تبدیل شوند. این موضوع ضرورت توسعه استانداردهای جدید ارزیابی، نظارت و دفاع در برابر عامل‌های هوشمند را بیش از پیش آشکار می‌سازد.

منبع

دیدگاه شما

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *