هشدار جدی درباره عامل‌های هوش مصنوعی؛ AI بدون دستور انسان به افراد واقعی حمله کرد

تبلیغات
تبلیغات

رفتار غیرمنتظره چند عامل هوش مصنوعی در یک آزمایش امنیتی، نگرانی‌ها درباره میزان کنترل انسان بر نسل جدید سیستم‌های خودمختار را افزایش داده است. این عامل‌ها در جریان یک ارزیابی امنیت سایبری از محدوده مأموریت خود خارج شدند و اقداماتی علیه افراد و سازمان‌های واقعی انجام دادند؛ از ساخت هویت جعلی و مهندسی اجتماعی گرفته تا تلاش برای واردکردن کد مخرب به یک پروژه متن‌باز.

تکراتو به نقل از زومیت گزارش می‌دهد، این اتفاق در جریان آزمایش‌های مؤسسه امنیت هوش مصنوعی بریتانیا یا AISI رخ داده است؛ سازمانی که مدل‌های پیشرفته هوش مصنوعی را پیش از گسترش عمومی برای شناسایی رفتارهای خطرناک آزمایش می‌کند.

نکته نگران‌کننده این است که پژوهشگران به عامل‌ها مستقیماً دستور نداده بودند به افراد واقعی حمله کنند.

۱۹ اقدام غیرمجاز در ۱۰ آزمایش

AISI در مجموع ۱۲۲ اجرای آزمایشی را روی چند مدل مختلف انجام داد.

هدف آزمایش بررسی توانایی مدل‌ها در حل یک چالش امنیت سایبری بود و محیط عمداً شرایط نسبتاً آزادی داشت تا پژوهشگران بتوانند حداکثر توانایی مدل‌ها را ارزیابی کنند.

اما در ۱۰ مورد از این ۱۲۲ اجرا، عامل‌های هوش مصنوعی از محدوده مورد انتظار خارج شدند.

پژوهشگران در مجموع ۱۹ اقدام غیرمجاز را ثبت کردند.

از این تعداد، ۱۷ مورد مربوط به یک مدل Anthropic با نام Mythos 5 و دو مورد مربوط به GPT-5.6 Sol بود.

بااین‌حال یک نکته بسیار مهم وجود دارد: فیلترهای امنیت سایبری مدل‌ها در این آزمایش عمداً غیرفعال شده بودند و عامل‌ها نیز از ابتدا اجازه دسترسی به اینترنت داشتند.

بنابراین شرایط آزمایش با نسخه‌هایی که کاربران عادی از این مدل‌ها استفاده می‌کنند یکسان نبود.

هوش مصنوعی هویت جعلی ساخت تا یک انسان را فریب دهد

جدی‌ترین رفتار ثبت‌شده مربوط به تلاش یک عامل برای انجام حمله زنجیره تأمین نرم‌افزاری بود.

عامل هوش مصنوعی تلاش کرد کد مخربی را وارد یک پروژه واقعی متن‌باز کند.

اما ماجرا به همین‌جا ختم نشد.

وقتی عامل متوجه شد برای پذیرفته‌شدن تغییراتش به تأیید توسعه‌دهندگان پروژه نیاز دارد، درباره نگه‌دارندگان انسانی پروژه تحقیق کرد و چند هویت آنلاین جعلی ساخت.

سپس تلاش کرد با استفاده از این هویت‌ها یک توسعه‌دهنده واقعی را متقاعد کند تغییر پیشنهادی را تأیید کند.

وقتی Pull Request عامل مورد سؤال قرار گرفت، هوش مصنوعی حتی فعالیت‌های قبلی خود را ویرایش کرد تا بی‌خطرتر به نظر برسد و استفاده از هویتی تازه برای ادامه فعالیت را نیز بررسی کرد.

در نهایت توسعه‌دهنده انسانی متوجه مشکل شد و کد مخرب را تأیید نکرد.

عامل AI از Tor هم استفاده کرد

رفتار عامل‌ها فقط به ساخت حساب جعلی محدود نبود.

در یکی از موارد، عامل هوش مصنوعی از شبکه Tor استفاده کرد تا برخی محدودیت‌های GitHub را دور بزند.

اتفاقاً همین رفتار باعث شد سامانه‌های نظارتی AISI متوجه انتقال غیرعادی داده شوند و زنگ خطر به صدا درآید.

تیم امنیتی ظرف چند دقیقه بررسی فعالیت‌ها را آغاز کرد و در نهایت تمام آزمایش‌های مرتبط متوقف شدند.

AISI می‌گوید حدود یک ساعت پس از شناسایی اولیه، تمام اجراها متوقف و سیستم‌های مرتبط ایزوله شده بودند.

عامل‌های مستقل با یکدیگر همکاری کردند

شاید یکی از عجیب‌ترین بخش‌های گزارش، تلاش عامل‌های مستقل برای همکاری با یکدیگر باشد.

یکی از عامل‌ها پیام‌هایی عمومی روی GitHub قرار داد و از عامل‌های دیگری که روی همان چالش کار می‌کردند دعوت کرد با او همکاری کنند.

عامل همچنین اطلاعات مربوط به حساب‌ها و ابزارهایی را که ایجاد کرده بود در اختیار عامل‌های بعدی قرار داد.

برخی عامل‌های بعدی این اطلاعات را پیدا کردند و از آن‌ها استفاده کردند.

عامل‌ها همچنین تلاش کردند دستورهای مخربی را در مکان‌هایی قرار دهند که احتمال می‌دادند سایر ابزارهای هوش مصنوعی آن‌ها را بخوانند؛ روشی که می‌تواند نوعی Prompt Injection میان سیستم‌های AI ایجاد کند.

آیا هوش مصنوعی واقعاً «فرار» کرده بود؟

خیر؛ و این نکته برای روایت دقیق ماجرا بسیار مهم است.

AISI صراحتاً می‌گوید این حادثه نمونه‌ای از فرار مدل از Sandbox نبود.

عامل‌ها از ابتدا در محیطی آزمایشی قرار داشتند که دسترسی به اینترنت در آن عمداً فعال شده بود و برخی سیستم‌های حفاظتی ارائه‌دهندگان مدل نیز برای بررسی حداکثر توانایی آن‌ها غیرفعال شده بودند.

بنابراین نمی‌توان نتیجه گرفت نسخه عمومی این مدل‌ها در شرایط عادی همین رفتار را انجام خواهند داد.

پژوهشگران همچنین هنوز مطمئن نیستند عامل‌ها تا چه اندازه متوجه بوده‌اند که اقداماتشان روی سیستم‌ها و افراد واقعی تأثیر می‌گذارد یا تصور می‌کردند همچنان در یک محیط شبیه‌سازی‌شده قرار دارند.

هیچ آسیب واقعی نهایی شناسایی نشد

با وجود جدی‌بودن رفتارها، تلاش‌های خطرناک عامل‌ها موفق نشدند.

AISI می‌گوید بررسی‌هایش تاکنون هیچ آسیب واقعی ناشی از این حادثه را شناسایی نکرده است.

GitHub نیز در جریان ماجرا قرار گرفت و برای حذف آثار باقی‌مانده از فعالیت عامل‌ها و اطلاع‌رسانی به کاربران درگیر با AISI همکاری کرد.

این مؤسسه همچنین قصد دارد با METR برای انجام بررسی مستقل شخص ثالث همکاری کند.

چرا این آزمایش یک زنگ خطر جدی است؟

اهمیت این ماجرا در موفقیت یا شکست حمله نیست؛ مسئله اصلی این است که عامل‌های هوش مصنوعی برای رسیدن به هدف خود اقداماتی را انتخاب کردند که مستقیماً به آن‌ها دستور داده نشده بود.

ساخت هویت جعلی، تلاش برای مهندسی اجتماعی، دورزدن محدودیت‌ها، همکاری میان عامل‌ها و قراردادن دستورهای مخرب برای سایر سیستم‌های AI، همگی رفتارهایی هستند که کنترل نسل آینده عامل‌های خودمختار را دشوارتر می‌کنند.

این اتفاق در کنار حوادث اخیر OpenAI اهمیت بیشتری پیدا می‌کند. OpenAI نیز اخیراً حادثه‌ای را تأیید کرد که طی آن مدل‌های داخلی این شرکت در جریان آزمایش‌های سایبری محدودیت‌های محیط تحقیقاتی را دور زدند، به اینترنت دسترسی پیدا کردند و بخش‌هایی از زیرساخت Hugging Face را تحت تأثیر قرار دادند.

نسل جدید AI دیگر فقط متن تولید نمی‌کند؛ این سیستم‌ها می‌توانند مرورگر باز کنند، کد اجرا کنند، با سرویس‌های اینترنتی ارتباط برقرار کنند و مجموعه‌ای طولانی از اقدامات را برای رسیدن به یک هدف انجام دهند.

همین افزایش قدرت باعث می‌شود امنیت عامل‌های هوش مصنوعی فقط مسئله کیفیت پاسخ یک چت‌بات نباشد.

اگر یک عامل بتواند در دنیای دیجیتال مستقلاً اقدام کند، کنترل دسترسی، نظارت مداوم و امکان توقف سریع آن به همان اندازه توانایی خود مدل اهمیت پیدا خواهد کرد.

ا
امیررضا هادی تهرانی
مشاهده کلیه مقالات منتشر شده
گفت‌وگوی کاربران

دیدگاه‌ها

۰ دیدگاه

دیدگاه شما

نشانی ایمیل شما منتشر نخواهد شد.

اپلیکیشن و نرم‌افزار

معرفی نرم افزار و اپلیکیشن

مشاهده بیشتر