آنتروپیک نسل تازهای از قدرتمندترین مدلهای هوش مصنوعی خود را معرفی کرده است. Claude Fable 5.1 و Claude Mythos 5.1 با تمرکز ویژه روی کدنویسی، تحقیقات پیچیده، کارهای چندمرحلهای و ایجنتهایی طراحی شدهاند که باید ساعتها یا حتی روزها بدون نظارت مداوم کار کنند.
تکراتو به نقل از دیجیاتو گزارش میدهد، Fable 5.1 بهصورت عمومی در دسترس قرار گرفته است؛ اما Mythos 5.1 بهدلیل تواناییهای پیشرفته در حوزههایی مانند امنیت سایبری و علوم زیستی فقط در اختیار مجموعهای محدود از سازمانهای تأییدشده قرار میگیرد.
Claude Fable 5.1 برای پروژههای طولانی ساخته شده است
آنتروپیک Fable 5.1 را مدل مناسب پروژههایی میداند که با یک سؤال و جواب ساده تمام نمیشوند.
این مدل برای انجام کارهای طولانی و ایجنتمحور طراحی شده است؛ برای مثال میتواند روی پروژهای بزرگ در یک کدبیس کار کند، آزمایشهای خودش را بنویسد، خطاهای ایجادشده را بررسی کند و درصورت شکست یک مرحله، مسیر دیگری برای ادامه کار پیدا کند.
در محیطهای سازمانی نیز مدل میتواند پروژههای چندمرحلهای شامل تحقیق، تحلیل اسناد و تولید فایلهای نهایی را با نظارت کمتری انجام دهد.
Fable 5.1 از پنجره زمینه یک میلیون توکنی برخوردار است و حداکثر خروجی آن به ۱۲۸ هزار توکن میرسد.
هزینه استفاده از Claude در ایجنتها کمتر شده است
یکی از مهمترین تغییرات Fable 5.1 کاهش قابلتوجه هزینه Cache Read است.
قیمت پایه مدل نسبت به Fable 5 تغییر نکرده و همچنان برای هر یک میلیون توکن ورودی ۱۰ دلار و برای هر یک میلیون توکن خروجی ۵۰ دلار دریافت میشود.
اما هزینه خواندن یک میلیون توکن از کش از یک دلار به تنها ۰٫۲۵ دلار کاهش پیدا کرده است؛ یعنی افت ۷۵ درصدی.
این موضوع برای ایجنتهای هوش مصنوعی اهمیت زیادی دارد، زیرا آنها در جریان انجام یک پروژه طولانی ممکن است بارها به کد، اسناد، دستورالعملها و اطلاعات قبلی مراجعه کنند.
آنتروپیک تخمین میزند این تغییر هزینه اجرای کارهای معمول را حدود ۲۵ درصد و هزینه برخی گردشکارهای بسیار ایجنتمحور را تا حدود ۴۵ درصد کاهش دهد.
عملکرد بهتر در کدنویسی و تحقیقات علمی
آنتروپیک برای نشاندادن توانایی مدل جدید نتایج مجموعهای از بنچمارکها را منتشر کرده است.
در Terminal-Bench-Science 0.1 که توانایی ایجنتها در انجام وظایف علمی را بررسی میکند، Fable 5.1 امتیاز ۵۲٫۶ درصد را به دست آورده است.
براساس نتایج منتشرشده توسط آنتروپیک، Fable 5 در همین آزمون امتیاز ۲۴٫۷ درصد و Opus 5 امتیاز ۲۹ درصد کسب کردهاند.
در Terminal-Bench 4.0 نیز امتیاز Fable 5.1 به ۵۵٫۸ درصد رسیده و در AutomationBench برای گردشکارهای تجاری امتیاز ۳۱٫۴ درصد ثبت شده است.
البته این نتایج عمدتاً از ارزیابیهای منتشرشده توسط خود آنتروپیک به دست آمدهاند و عملکرد واقعی مدل بسته به نوع پروژه، ابزارها و تنظیمات مورد استفاده متفاوت خواهد بود.
Fable و Mythos چه تفاوتی دارند؟
نکته جالب این است که Fable 5.1 و Mythos 5.1 از نظر قابلیتهای اصلی و مشخصات فنی یکسان هستند.
هر دو پنجره زمینه یک میلیون توکنی، حداکثر خروجی ۱۲۸ هزار توکنی و قیمت پایه ۱۰ دلار برای ورودی و ۵۰ دلار برای خروجی دارند.
تفاوت اصلی به سطح دسترسی و محدودیتهای ایمنی مربوط میشود.
Claude Fable 5.1 همان مدل پایه Mythos 5.1 است که محدودیتهای بیشتری برای حوزههای حساس امنیت سایبری و زیستشناسی روی آن اعمال شده تا امکان عرضه عمومی آن فراهم شود.
Mythos 5.1 در مقابل برای سازمانهای تأییدشدهای ارائه میشود که به قابلیتهای پیشرفتهتر در این حوزهها نیاز دارند.
محدودیتهای Claude کمتر اشتباه میکنند
آنتروپیک در نسل جدید روی یکی از انتقادهای مهم کاربران نیز کار کرده است: مسدودشدن درخواستهای بیخطر.
این شرکت میگوید محدودیتهای امنیت سایبری Fable 5.1 نسبت به گذشته دقیقتر شدهاند و کمتر درخواستهای سالم را بهاشتباه متوقف میکنند.
Fable 5.1 اکنون میتواند برای شناسایی آسیبپذیری در سورسکد نرمافزار مورد استفاده قرار گیرد.
بااینحال فعالیتهایی مانند تولید اکسپلویت، تست نفوذ و برخی انواع اسکن آسیبپذیری همچنان محدود هستند یا به مدلهای دیگری هدایت میشوند.
در حوزه زیستشناسی نیز آنتروپیک میگوید سیستم جدید نسبت به نسل اولیه محدودیتهای Fable 5 حدود ۸۵ درصد کمتر روی درخواستهای بیخطر مداخله میکند.
Fable 5.1 حالا در دسترس کاربران Claude است
Claude Fable 5.1 برای کاربران Pro، Max، Team و Enterprise ارائه شده و توسعهدهندگان نیز میتوانند از طریق Claude API به آن دسترسی داشته باشند.
این مدل همچنین از طریق سرویسهای ابری و پلتفرمهایی از جمله Amazon Web Services، Google Cloud و Microsoft Foundry ارائه میشود.
Mythos 5.1 شرایط متفاوتی دارد و فعلاً تنها سازمانهای تأییدشده از طریق برنامههای دسترسی ویژه آنتروپیک میتوانند از آن استفاده کنند.
Fable 5.1 نشان میدهد رقابت مدلهای هوش مصنوعی بهتدریج از پاسخدادن سریع به سؤالها به سمت انجام مستقل پروژههای بسیار بزرگ حرکت میکند؛ جایی که یک مدل باید بتواند ساعتها کار کند، ابزارهای مختلف را به خدمت بگیرد، اشتباهات خودش را اصلاح کند و در نهایت یک پروژه کامل تحویل دهد.

