شیائومی MiMo-V2.6 را متن‌باز کرد؛ مدل یک تریلیون پارامتری با کانتکست یک میلیون توکنی

شیائومی خانواده جدید مدل‌های هوش مصنوعی MiMo-V2.6 را به‌صورت متن‌باز منتشر کرده است؛ خانواده‌ای که تمرکز اصلی آن روی گسترش یادگیری تقویتی، انجام وظایف طولانی و حرکت به سمت سیستم‌های هوش مصنوعی با قابلیت خودبهبودی قرار دارد.

خانواده جدید شامل MiMo-V2.6-Pro به‌عنوان مدل پرچمدار و MiMo-V2.6-Flash به‌عنوان نسخه‌ای با تعادل بیشتر میان قدرت پردازشی، سرعت و هزینه می‌شود.

شیائومی می‌گوید برخلاف رویکردهایی که برای هر حوزه یک مرحله یادگیری تقویتی جداگانه اجرا می‌کنند، MiMo-V2.6 در یک فرایند ترکیبی روی برنامه‌نویسی، ایجنت‌های عمومی، وظایف بصری و امنیت سایبری آموزش دیده است.

MiMo-V2.6 یک مدل یک تریلیون پارامتری است

نسخه Pro از معماری Mixture of Experts یا MoE استفاده می‌کند و در مجموع ۱٫۰۲ تریلیون پارامتر دارد؛ بااین‌حال در هر مرحله حدود ۴۲ میلیارد پارامتر آن فعال می‌شوند.

یکی دیگر از ویژگی‌های مهم این مدل، پنجره متنی یک میلیون توکنی است که به MiMo اجازه می‌دهد مخازن بزرگ کد، تاریخچه طولانی استفاده از ابزارها و وظایف چندمرحله‌ای ایجنت‌ها را در یک کانتکست مدیریت کند.

MiMo-V2.6 همچنین به‌صورت بومی چندوجهی طراحی شده و می‌تواند متن، تصویر، ویدیو و صدا را پردازش کند.

شیائومی برای پردازش تصویر از یک انکودر MiMo ViT با ۶۸۱ میلیون پارامتر و برای بخش صوتی نیز از AudioTokenizer با ۳۰۸ میلیون پارامتر به‌همراه یک انکودر صوتی ۱۲۷ میلیون پارامتری استفاده کرده است.

یادگیری تقویتی در مقیاس میلیاردها توکن

یکی از مهم‌ترین بخش‌های پروژه MiMo-V2.6، افزایش شدید مقیاس یادگیری تقویتی است.

شیائومی از نسخه کاملاً ناهمگام الگوریتم GRPO استفاده کرده که در هر مرحله ۱٬۵۶۸ پرامپت را با ۱۶ اجرای مستقل برای هر پرامپت پردازش می‌کند.

براساس اطلاعات منتشرشده، در هر به‌روزرسانی مدل میلیاردها توکن پردازش می‌شود و حداکثر طول کانتکست نیز می‌تواند به یک میلیون توکن برسد.

تیم MiMo همچنین تمام حوزه‌های آموزشی از جمله برنامه‌نویسی، ایجنت‌های عمومی، پردازش بصری و امنیت سایبری را در یک اجرای مشترک یادگیری تقویتی ترکیب کرده است تا مهارت‌هایی که مدل در یک حوزه یاد می‌گیرد بتوانند به حوزه‌های دیگر منتقل شوند.

شیائومی به‌دنبال ساخت حلقه خودبهبودی هوش مصنوعی است

یکی از ایده‌های اصلی MiMo-V2.6 ایجاد نوعی حلقه خودبهبودی در جریان آموزش است.

شیائومی برای این کار از سیستمی استفاده می‌کند که تنها به درست یا غلط بودن یک پاسخ نگاه نمی‌کند؛ بلکه چند پاسخ موفق مدل را با یکدیگر مقایسه می‌کند تا مشخص شود کدام مسیر، کیفیت بیشتر، مراحل کمتر و مصرف توکن پایین‌تری دارد.

این سازوکار باعث می‌شود مدل به‌مرور به سمت راه‌حل‌های کوتاه‌تر و کارآمدتر حرکت کند.

تیم MiMo همچنین از روش‌های مختلف برای جلوگیری از سوءاستفاده مدل از سیستم پاداش و افزایش صحت ارزیابی‌ها استفاده کرده است.

عملکرد قدرتمند MiMo-V2.6 در برنامه‌نویسی و ایجنت‌ها

طبق نتایج رسمی منتشرشده توسط شیائومی، MiMo-V2.6-Pro در بنچمارک DeepSWE v1.1 امتیاز ۷۱٫۹ و نسخه Flash امتیاز ۶۷٫۹ را به دست آورده‌اند؛ درحالی‌که MiMo-V2.5-Pro در همین آزمون امتیاز ۱۹ را ثبت کرده بود.

در آزمون AutomationBench نیز مدل Pro امتیاز ۵۳٫۱ را به دست آورده و در Terminal Bench 2.1 به امتیاز ۸۹٫۹ رسیده است.

MiMo-V2.6 تنها برای تولید کد طراحی نشده و می‌تواند در محیط‌های مختلف با ابزارها و نرم‌افزارها نیز تعامل داشته باشد. شیائومی نمونه‌هایی از ساخت محیط‌های سه‌بعدی در Blender، طراحی رابط کاربری، تولید محتوای چندرسانه‌ای و حتی کنترل ربات در محیط شبیه‌سازی‌شده را نمایش داده است.

MiMo-V2.6 متن‌باز منتشر شد

نسخه‌های MiMo-V2.6-Pro-RL و MiMo-V2.6-Flash-RL با مجوز متن‌باز در Hugging Face منتشر شده‌اند و توسعه‌دهندگان می‌توانند مدل‌ها را دانلود و روی زیرساخت‌های خود اجرا کنند.

یک نسخه کوچک‌تر ۹ میلیارد پارامتری با نام MiMo-V2.6-Distill-Qwen-9B نیز منتشر شده که بر پایه خانواده Qwen توسعه یافته است.

مدل‌های جدید شیائومی همچنین از طریق AI Studio، سرویس API اختصاصی MiMo، MiMo Desktop و برخی سرویس‌های ابری در اختیار کاربران قرار گرفته‌اند.

انتشار MiMo-V2.6 نشان می‌دهد رقابت مدل‌های متن‌باز دیگر تنها روی افزایش تعداد پارامترها متمرکز نیست و شرکت‌ها حالا در تلاش‌اند مقیاس یادگیری تقویتی، استفاده از ابزارها و توانایی اجرای وظایف طولانی توسط ایجنت‌ها را نیز افزایش دهند.

ا
امیررضا هادی تهرانی
مشاهده کلیه مقالات منتشر شده
گفت‌وگوی کاربران

دیدگاه‌ها

۰ دیدگاه

دیدگاه شما

نشانی ایمیل شما منتشر نخواهد شد.

اپلیکیشن و نرم‌افزار

معرفی نرم افزار و اپلیکیشن

مشاهده بیشتر