شیائومی خانواده جدید مدلهای هوش مصنوعی MiMo-V2.6 را بهصورت متنباز منتشر کرده است؛ خانوادهای که تمرکز اصلی آن روی گسترش یادگیری تقویتی، انجام وظایف طولانی و حرکت به سمت سیستمهای هوش مصنوعی با قابلیت خودبهبودی قرار دارد.
خانواده جدید شامل MiMo-V2.6-Pro بهعنوان مدل پرچمدار و MiMo-V2.6-Flash بهعنوان نسخهای با تعادل بیشتر میان قدرت پردازشی، سرعت و هزینه میشود.
شیائومی میگوید برخلاف رویکردهایی که برای هر حوزه یک مرحله یادگیری تقویتی جداگانه اجرا میکنند، MiMo-V2.6 در یک فرایند ترکیبی روی برنامهنویسی، ایجنتهای عمومی، وظایف بصری و امنیت سایبری آموزش دیده است.
MiMo-V2.6 یک مدل یک تریلیون پارامتری است
نسخه Pro از معماری Mixture of Experts یا MoE استفاده میکند و در مجموع ۱٫۰۲ تریلیون پارامتر دارد؛ بااینحال در هر مرحله حدود ۴۲ میلیارد پارامتر آن فعال میشوند.
یکی دیگر از ویژگیهای مهم این مدل، پنجره متنی یک میلیون توکنی است که به MiMo اجازه میدهد مخازن بزرگ کد، تاریخچه طولانی استفاده از ابزارها و وظایف چندمرحلهای ایجنتها را در یک کانتکست مدیریت کند.
MiMo-V2.6 همچنین بهصورت بومی چندوجهی طراحی شده و میتواند متن، تصویر، ویدیو و صدا را پردازش کند.
شیائومی برای پردازش تصویر از یک انکودر MiMo ViT با ۶۸۱ میلیون پارامتر و برای بخش صوتی نیز از AudioTokenizer با ۳۰۸ میلیون پارامتر بههمراه یک انکودر صوتی ۱۲۷ میلیون پارامتری استفاده کرده است.
یادگیری تقویتی در مقیاس میلیاردها توکن
یکی از مهمترین بخشهای پروژه MiMo-V2.6، افزایش شدید مقیاس یادگیری تقویتی است.
شیائومی از نسخه کاملاً ناهمگام الگوریتم GRPO استفاده کرده که در هر مرحله ۱٬۵۶۸ پرامپت را با ۱۶ اجرای مستقل برای هر پرامپت پردازش میکند.
براساس اطلاعات منتشرشده، در هر بهروزرسانی مدل میلیاردها توکن پردازش میشود و حداکثر طول کانتکست نیز میتواند به یک میلیون توکن برسد.
تیم MiMo همچنین تمام حوزههای آموزشی از جمله برنامهنویسی، ایجنتهای عمومی، پردازش بصری و امنیت سایبری را در یک اجرای مشترک یادگیری تقویتی ترکیب کرده است تا مهارتهایی که مدل در یک حوزه یاد میگیرد بتوانند به حوزههای دیگر منتقل شوند.
شیائومی بهدنبال ساخت حلقه خودبهبودی هوش مصنوعی است
یکی از ایدههای اصلی MiMo-V2.6 ایجاد نوعی حلقه خودبهبودی در جریان آموزش است.
شیائومی برای این کار از سیستمی استفاده میکند که تنها به درست یا غلط بودن یک پاسخ نگاه نمیکند؛ بلکه چند پاسخ موفق مدل را با یکدیگر مقایسه میکند تا مشخص شود کدام مسیر، کیفیت بیشتر، مراحل کمتر و مصرف توکن پایینتری دارد.
این سازوکار باعث میشود مدل بهمرور به سمت راهحلهای کوتاهتر و کارآمدتر حرکت کند.
تیم MiMo همچنین از روشهای مختلف برای جلوگیری از سوءاستفاده مدل از سیستم پاداش و افزایش صحت ارزیابیها استفاده کرده است.
عملکرد قدرتمند MiMo-V2.6 در برنامهنویسی و ایجنتها
طبق نتایج رسمی منتشرشده توسط شیائومی، MiMo-V2.6-Pro در بنچمارک DeepSWE v1.1 امتیاز ۷۱٫۹ و نسخه Flash امتیاز ۶۷٫۹ را به دست آوردهاند؛ درحالیکه MiMo-V2.5-Pro در همین آزمون امتیاز ۱۹ را ثبت کرده بود.
در آزمون AutomationBench نیز مدل Pro امتیاز ۵۳٫۱ را به دست آورده و در Terminal Bench 2.1 به امتیاز ۸۹٫۹ رسیده است.
MiMo-V2.6 تنها برای تولید کد طراحی نشده و میتواند در محیطهای مختلف با ابزارها و نرمافزارها نیز تعامل داشته باشد. شیائومی نمونههایی از ساخت محیطهای سهبعدی در Blender، طراحی رابط کاربری، تولید محتوای چندرسانهای و حتی کنترل ربات در محیط شبیهسازیشده را نمایش داده است.
MiMo-V2.6 متنباز منتشر شد
نسخههای MiMo-V2.6-Pro-RL و MiMo-V2.6-Flash-RL با مجوز متنباز در Hugging Face منتشر شدهاند و توسعهدهندگان میتوانند مدلها را دانلود و روی زیرساختهای خود اجرا کنند.
یک نسخه کوچکتر ۹ میلیارد پارامتری با نام MiMo-V2.6-Distill-Qwen-9B نیز منتشر شده که بر پایه خانواده Qwen توسعه یافته است.
مدلهای جدید شیائومی همچنین از طریق AI Studio، سرویس API اختصاصی MiMo، MiMo Desktop و برخی سرویسهای ابری در اختیار کاربران قرار گرفتهاند.
انتشار MiMo-V2.6 نشان میدهد رقابت مدلهای متنباز دیگر تنها روی افزایش تعداد پارامترها متمرکز نیست و شرکتها حالا در تلاشاند مقیاس یادگیری تقویتی، استفاده از ابزارها و توانایی اجرای وظایف طولانی توسط ایجنتها را نیز افزایش دهند.





دیدگاهها