همین حالا برای دوستان خود به اشتراک بگذارید: واتساپ | تلگرام |

«افکار مخفی» مدل‌های هوش مصنوعی آن‌قدرها هم مخفی نیست

پژوهشگران امنیتی از کشف روشی خبر داده‌اند که امکان استخراج بخش‌هایی از استدلال پنهان مدل‌های هوش مصنوعی بزرگ را فراهم می‌کند؛ آسیب‌پذیری قابل‌توجهی که مدل‌های شرکت‌هایی مانند OpenAI، Anthropic و Google را تحت تأثیر قرار داده و حتی در برخی موارد به بازیابی اطلاعات حساس منجر شده است.

به گزارش تکراتو و به نقل از دیجیاتو، گروهی از پژوهشگران در مطالعه‌ای جدید نشان داده‌اند که سازوکار مورد استفاده برای مخفی نگه‌داشتن زنجیره استدلال یا Chain of Thought در برخی APIهای مدل‌های هوش مصنوعی، دارای یک ضعف معماری بوده است. این نقص به محققان اجازه داده است بخش‌هایی از «تفکر» داخلی مدل‌ها را که قرار نبود کاربران مشاهده کنند، بازیابی کنند.

قیمت روز گوشی های بازار ایران

نتایج کامل این تحقیقات در مقاله‌ای با عنوان «Stealing Reasoning Traces from Proprietary LLM APIs» منتشر شده است.

استدلال پنهان مدل‌های هوش مصنوعی چگونه لو رفت؟

مدل‌های استدلالی پیشرفته معمولاً پیش از ارائه پاسخ نهایی، مجموعه‌ای از مراحل میانی را برای حل مسئله طی می‌کنند. این فرایند با عنوان Chain of Thought یا زنجیره استدلال شناخته می‌شود.

شرکت‌های بزرگ هوش مصنوعی معمولاً استدلال خام مدل‌های خود را مستقیماً در اختیار کاربران قرار نمی‌دهند. یکی از دلایل این تصمیم، حفاظت از مالکیت فکری و جلوگیری از استخراج قابلیت‌های مدل توسط رقبا است.

بااین‌حال، پژوهشگران متوجه شدند برخی ارائه‌دهندگان به جای نگهداری کامل این اطلاعات در سمت سرور، بلوک‌های استدلال رمزگذاری‌شده را برای کلاینت ارسال می‌کنند تا در درخواست‌های بعدی دوباره به سیستم بازگردانده شوند.

مشکل دقیقاً از همین‌جا آغاز می‌شود.

محققان دریافتند این بلوک‌های رمزگذاری‌شده در شرایطی می‌توانند میان نشست‌ها، کاربران و حتی مدل‌های مختلف یک ارائه‌دهنده سازگار باشند. این ویژگی زمینه را برای حمله‌ای فراهم کرده که پژوهشگران آن را برای رمزگشایی استدلال مدل‌های قدرتمند مورد استفاده قرار داده‌اند.

یک مدل ضعیف‌تر، افکار مدل قدرتمندتر را فاش می‌کند

روش مورد استفاده پژوهشگران ایده جالبی دارد. به جای تلاش برای شکستن مستقیم محدودیت‌های امنیتی مدل قدرتمند، بلوک رمزگذاری‌شده حاوی استدلال آن به یک مدل ضعیف‌تر و دارای محافظت‌های کمتر منتقل می‌شود.

سپس مدل دوم در شرایط خاص می‌تواند محتوای این بلوک را به متن قابل خواندن تبدیل کند.

به این ترتیب، مهاجم بدون نیاز به جیلبریک مستقیم مدل اصلی می‌تواند به اطلاعاتی دسترسی پیدا کند که اساساً برای مشاهده کاربر طراحی نشده‌اند.

پژوهشگران اعلام کرده‌اند این روش را روی اکوسیستم مدل‌های OpenAI، Anthropic و Google آزمایش کرده‌اند.

خطر فقط افشای افکار هوش مصنوعی نیست

شاید در نگاه اول افشای Chain of Thought صرفاً مسئله‌ای مربوط به مالکیت فکری شرکت‌های AI به نظر برسد، اما یافته‌های پژوهش جدید نشان می‌دهد پیامدهای امنیتی آن می‌تواند جدی‌تر باشد.

پژوهشگران ۳۱۵ هزار و ۳۲۰ بلوک استدلال رمزگذاری‌شده را که در مخازن عمومی منتشر شده بودند بررسی و رمزگشایی کردند.

نتیجه قابل‌توجه بود.

در میان داده‌های استخراج‌شده، ۳۶۷ مورد اطلاعات قابل شناسایی شخصی یا PII و ۱۸۲ مورد اطلاعات احراز هویت و Credential پیدا شد.

این یافته نشان می‌دهد توسعه‌دهندگانی که لاگ نشست‌های مدل‌های هوش مصنوعی را به‌صورت عمومی منتشر می‌کنند، ممکن است بدون اطلاع خود اطلاعات حساسی را نیز در قالب بلوک‌های رمزگذاری‌شده منتشر کرده باشند.

اطلاعات خطرناک می‌توانند در استدلال مخفی باقی بمانند

یافته مهم دیگر پژوهش به سیستم‌های ایمنی مدل‌های هوش مصنوعی مربوط می‌شود.

یک مدل ممکن است درخواست خطرناک کاربر را در پاسخ نهایی رد کند، اما این الزاماً به این معنی نیست که هیچ اطلاعات حساسی در جریان پردازش درخواست تولید نشده است.

محققان نشان داده‌اند در برخی شرایط، استدلال داخلی مدل می‌تواند شامل اطلاعاتی باشد که در پاسخ نهایی به دلیل سازوکارهای ایمنی نمایش داده نمی‌شوند.

در نتیجه، استخراج Chain of Thought می‌تواند راهی برای دور زدن بخشی از حفاظ‌های امنیتی مدل باشد؛ حتی اگر پاسخ قابل مشاهده مدل کاملاً مطابق سیاست‌های ایمنی باشد.

امکان حملات Prompt Injection نامرئی

این آسیب‌پذیری یک پیامد امنیتی دیگر نیز دارد: Prompt Injection مخفی.

براساس مقاله پژوهشگران، مهاجم در شرایط خاص می‌تواند محتوای مخرب را در بلوک‌های رمزگذاری‌شده قرار دهد. از آنجا که این اطلاعات برای کاربر قابل مشاهده نیستند، امکان ایجاد نوعی تزریق دستور نامرئی به وجود می‌آید.

این مسئله به‌خصوص برای سیستم‌های Agentic AI اهمیت دارد؛ سیستم‌هایی که مدل هوش مصنوعی علاوه بر تولید متن، اجازه استفاده از ابزارها و انجام برخی اقدامات را نیز دارد.

مشکل بزرگ دیگری به نام Distillation

یکی از مهم‌ترین پیامدهای تجاری این آسیب‌پذیری به «تقطیر مدل» یا Model Distillation مربوط می‌شود.

در این روش، خروجی یک مدل قدرتمند می‌تواند برای آموزش مدل دیگری مورد استفاده قرار گیرد تا مدل دوم بخشی از توانایی‌ها و الگوهای رفتاری مدل اصلی را یاد بگیرد.

شرکت‌های سازنده مدل‌های پیشرفته تلاش می‌کنند از استخراج گسترده قابلیت‌های مدل‌های خود جلوگیری کنند؛ چراکه توسعه مدل‌های Frontier میلیاردها دلار هزینه دارد و استدلال داخلی آنها بخشی از مالکیت فکری شرکت محسوب می‌شود.

اما روش جدید می‌تواند بخشی از مکانیسم‌های ضد Distillation را تضعیف کند؛ زیرا مهاجم به جای دریافت صرفاً پاسخ نهایی، امکان دستیابی به مراحل استدلال مدل را نیز پیدا می‌کند.

شباهت عجیب استدلال برخی مدل‌های چینی

این پژوهش یک بخش جنجالی دیگر نیز دارد.

محققان با بررسی استدلال‌های استخراج‌شده، شباهت‌هایی میان الگوهای استدلال بعضی مدل‌های بسته آمریکایی و مدل‌های دیگر مشاهده کرده‌اند.

گزارش WIRED نیز به شباهت‌هایی میان ردپاهای استدلال Claude Opus و GPT-5.6 Sol با مدل چینی Kimi K3 اشاره می‌کند؛ موضوعی که می‌تواند با بحث استفاده از Distillation در توسعه مدل‌های هوش مصنوعی مرتبط باشد.

بااین‌حال، پژوهشگران تأکید می‌کنند که این شباهت‌ها به‌تنهایی اثبات نمی‌کنند که یک شرکت عمداً مدل رقیب را کپی یا از طریق Distillation بازتولید کرده است.

موضوع Distillation طی ماه‌های اخیر به یکی از نقاط اصلی اختلاف میان شرکت‌های هوش مصنوعی آمریکا و چین تبدیل شده است. شرکت Anthropic نیز پیش‌تر اعلام کرده بود کمپین‌هایی در مقیاس صنعتی را شناسایی کرده که به گفته این شرکت توسط آزمایشگاه‌هایی از جمله DeepSeek، Moonshot AI و MiniMax برای استخراج قابلیت‌های Claude انجام شده‌اند.

آسیب‌پذیری به شرکت‌های هوش مصنوعی گزارش شده است

نکته مهم این است که پژوهشگران پیش از انتشار عمومی جزئیات، یافته‌های خود را از طریق فرایند Responsible Disclosure در اختیار شرکت‌های مربوطه قرار داده‌اند.

آنها همچنین مجموعه‌ای از راهکارهای رمزنگاری و معماری را برای جلوگیری از تکرار چنین حملاتی پیشنهاد کرده‌اند.

بااین‌حال، پژوهش تازه یک مسئله مهم‌تر را درباره آینده مدل‌های استدلالی مطرح می‌کند: مخفی کردن Chain of Thought لزوماً به معنی امن ماندن آن نیست.

با گسترش مدل‌های استدلالی و ایجنت‌های هوش مصنوعی، اطلاعاتی که در مراحل داخلی پردازش می‌شوند می‌توانند از نظر امنیتی تقریباً به اندازه پاسخ نهایی اهمیت داشته باشند. یافته‌های جدید نشان می‌دهد حفاظت از این بخش پنهان، احتمالاً به یکی از چالش‌های مهم امنیت AI در سال‌های آینده تبدیل خواهد شد.

ارسال برای دوستان در: واتساپ | تلگرام |




ارسال نظر