OpenAI برای عرضه مدل قدرتمند Astra آماده میشود؛ اما پیش از آنکه این هوش مصنوعی بهصورت گسترده در اختیار کاربران قرار بگیرد، برخی پژوهشگران ایمنی درباره یکی از مهمترین ویژگیهای احتمالی معماری آن هشدار دادهاند. نگرانی اصلی این است که روش جدید استدلال Astra میتواند مشاهده و نظارت بر فرایند تصمیمگیری مدل را دشوارتر کند.
تکراتو به نقل از زومیت گزارش میدهد، Astra احتمالاً از روشی موسوم به recurrent depth یا «opaque recurrence» استفاده میکند؛ تکنیکی که به مدل اجازه میدهد بخشی از پردازش خود را بهصورت تکرارشونده و درونی انجام دهد.
همین مسئله این سؤال را ایجاد کرده است که اگر بخش بیشتری از استدلال مدل برای سیستمهای نظارتی قابل مشاهده نباشد، چگونه میتوان رفتارهای خطرناک آن را پیش از تبدیلشدن به یک اقدام واقعی شناسایی کرد؟
چرا روش استدلال Astra نگرانکننده شده است؟
یکی از روشهای مورد استفاده برای بررسی رفتار مدلهای استدلالی، Chain-of-Thought Monitoring است.
در چنین رویکردی، سیستمهای نظارتی میتوانند بخشی از مسیر استدلال مدل را بررسی کنند و در صورت مشاهده نشانههایی از رفتار خطرناک، فریب، دورزدن محدودیتها یا تلاش برای دسترسی غیرمجاز واکنش نشان دهند.
OpenAI نیز در سیستمهای داخلی خود از مانیتورهایی استفاده میکند که Chain of Thought مدل را برای شناسایی فعالیتهای پرخطر بررسی میکنند.
اما معماری گزارششده برای Astra میتواند این کار را پیچیدهتر کند.
در recurrent depth، بخشی از محاسبات میتواند درون چرخههای پردازشی مدل انجام شود و الزاماً تمام این فرایند به همان شکل متنی و قابل مشاهدهای که در مدلهای استدلالی مرسوم میبینیم ظاهر نمیشود.
هوش مصنوعی قدرتمندتر، اما سختتر برای نظارت
نگرانی پژوهشگران فقط نظری نیست.
Ryan Greenblatt از Redwood Research هشدار داده است که حرکت به سمت مدلهایی که فرایند استدلال آنها کمتر قابل مشاهده باشد، میتواند ابزار مهم Chain-of-Thought Monitoring را تضعیف کند.
مسئله زمانی جدیتر میشود که این تغییر معماری را در کنار تواناییهای Astra قرار دهیم.
OpenAI رسماً اعلام کرده Astra نخستین مدل این شرکت است که به سطح Critical در بخش تواناییهای سایبری طبق Preparedness Framework رسیده است.
این یعنی Astra با ابزار و دسترسی مناسب میتواند آسیبپذیریهای امنیتی ناشناخته را در سیستمهای محافظتشده پیدا کند و برای بهرهبرداری از آنها روش عملی توسعه دهد؛ آن هم بدون اینکه انسان مجبور باشد تمام مراحل را قدمبهقدم هدایت کند.
ترکیب چنین قدرتی با کاهش احتمالی قابلیت مشاهده فرایند استدلال، دلیل اصلی حساسیت پژوهشگران ایمنی است.
OpenAI خودش هم Astra را دائماً زیر نظر دارد
OpenAI از مدتها قبل متوجه افزایش ریسک مدلهای جدید خود شده است.
این شرکت در ماه اوت اعلام کرد پس از مشاهده نشانههای رسیدن Astra به سطح Critical، استانداردهای امنیتی توسعه مدل را افزایش داده است.
OpenAI حتی بخشی از فعالیتهای داخلی مرتبط با Astra را که هنوز با استاندارد امنیتی جدید سازگار نشده بودند متوقف کرد.
یکی از مهمترین اقدامات شرکت، گسترش نظارت بر رفتار مدل است.
OpenAI اعلام کرده تمام استفادههای Agentic از Astra در مراحل آموزش و ارزیابی تحت مانیتورینگ قرار دارند و سیستمهای نظارتی میتوانند فعالیتهای پرخطر را شناسایی کرده و برای بررسی یا متوقفکردن آنها واکنش امنیتی ایجاد کنند.
شرکت همچنین محیطهای آزمایش ایزوله، محدودیت دسترسی به شبکه و ابزارها، حفاظت قویتر از وزن مدل، رمزنگاری و اجرای Sandbox را به اقدامات امنیتی Astra اضافه کرده است.
یک حادثه واقعی نگرانیها را جدیتر کرد
نگرانی درباره کنترل مدلهای فوققدرتمند پس از حادثهای که در جریان ارزیابی مدلهای OpenAI و Hugging Face رخ داد جدیتر شده است.
در آن اتفاق، عاملهای هوش مصنوعی هنگام تلاش برای حل یک ارزیابی امنیتی، زنجیرهای از آسیبپذیریها را در محیط تحقیقاتی OpenAI و زیرساخت تولید Hugging Face پیدا و از آنها استفاده کردند.
OpenAI تأکید کرده Astra مدل دخیل در آن حادثه نبوده است.
اما این اتفاق نشان داد تواناییهای سایبری مدلهای پیشرفته دیگر صرفاً در محیطهای آزمایشگاهی و بنچمارکها معنا ندارند و ممکن است در زیرساخت واقعی نیز مسیرهای حملهای پیدا کنند که طراحان سیستم انتظار آن را نداشتهاند.
OpenAI پس از این حادثه اعلام کرد کنترلهای مربوط به ایزولهسازی، مانیتورینگ، دسترسی و ارزیابی مدلهای پیشرفته را تقویت میکند.
آیا Astra واقعاً غیرقابلکنترل است؟
درحالحاضر پاسخ منفی است و شواهدی وجود ندارد که نشان دهد Astra یک مدل «غیرقابلکنترل» است.
نگرانی پژوهشگران درباره یک ریسک فنی مشخص است: اگر معماری مدل باعث شود بخش مهمی از استدلال داخلی آن کمتر قابل مشاهده باشد، یکی از ابزارهای مهم برای تشخیص رفتارهای ناخواسته میتواند کارایی کمتری داشته باشد.
از طرف دیگر، OpenAI میگوید حفاظتهای Astra را تقویت کرده و پس از چند هفته تأخیر و آزمایش بیشتر، اکنون معتقد است تدابیر امنیتی موجود میتوانند خطر آسیب شدید را برای عرضه تحت Preparedness Framework به اندازه کافی کاهش دهند.
این شرکت همچنین دسترسی به قدرتمندترین قابلیتهای سایبری Astra را در ابتدای عرضه محدود خواهد کرد.
Astra آزمون بزرگی برای آینده هوش مصنوعی است
بحث پیرامون Astra فقط درباره یک محصول OpenAI نیست.
هرچه مدلهای هوش مصنوعی توانایی بیشتری برای برنامهنویسی، استفاده از ابزار، جستوجوی آسیبپذیری و انجام مستقل مأموریتهای طولانی پیدا کنند، نظارت بر تصمیمهای آنها اهمیت بیشتری خواهد داشت.
در چنین شرایطی یک تضاد مهم شکل میگیرد: معماریهای جدید میتوانند مدلها را قدرتمندتر و کارآمدتر کنند، اما اگر همان معماریها مشاهده نحوه تصمیمگیری مدل را دشوار کنند، سیستمهای ایمنی نیز باید با سرعت مشابهی پیشرفت کنند.
Astra یکی از اولین نمونههایی است که این مسئله را بهصورت جدی مقابل صنعت هوش مصنوعی قرار میدهد.
مدلی که از یک طرف میتواند آسیبپذیریهای ناشناخته را کشف کند و از طرف دیگر، پژوهشگران اکنون درباره میزان شفافیت فرایند استدلال آن سؤال دارند.
به همین دلیل عرضه Astra احتمالاً فقط یک رقابت دیگر بر سر قدرتمندترین مدل هوش مصنوعی نخواهد بود؛ بلکه آزمونی مهم برای این سؤال است که آیا صنعت AI میتواند مدلهایی را که هر روز مستقلتر و قدرتمندتر میشوند، همچنان بهطور مؤثر زیر نظر داشته باشد یا خیر.






دیدگاهها