علیبابا نسل جدید مدل هوش مصنوعی تولید ویدیو خود با نام Wan 3.0 را معرفی کرده است؛ مدلی که میتواند در یک مرحله ویدیوهایی تا ۳۰ ثانیه تولید کند و برخلاف بسیاری از رقبای خود، تنها به پرامپت متنی یا تصویر محدود نیست.
Wan 3.0 میتواند متن، تصویر، فایل صوتی، ویدیو و حتی اسنادی مانند PDF، PowerPoint، Word و Excel را بهعنوان ورودی دریافت کند. به این ترتیب، کاربر میتواند برای مثال یک فایل ارائه یا سند را در اختیار مدل قرار دهد و از هوش مصنوعی بخواهد محتوای آن را به یک ویدیوی منسجم تبدیل کند.
از PDF و پاورپوینت تا ویدیوی هوش مصنوعی
یکی از مهمترین قابلیتهای Wan 3.0 پشتیبانی از ورودیهای چندوجهی است.
علیبابا میگوید مدل جدید میتواند اطلاعات موجود در اسناد متنی و فایلهای مختلف را درک کرده و آنها را به محتوای ویدیویی تبدیل کند.
این قابلیت میتواند کاربرد Wan 3.0 را فراتر از ساخت کلیپهای سرگرمکننده ببرد. برای مثال، یک کسبوکار میتواند از اسناد معرفی محصول، گزارشها یا فایلهای ارائه برای تولید سریع محتوای ویدیویی استفاده کند.
ساخت ویدیوی ۳۰ ثانیهای در یک مرحله
یکی دیگر از پیشرفتهای مهم Wan 3.0 افزایش مدت ویدیوهای تولیدشده است.
این مدل میتواند کلیپهایی با حداکثر مدت ۳۰ ثانیه را در یک مرحله تولید کند؛ بدون اینکه لازم باشد چند کلیپ کوتاهتر به یکدیگر متصل شوند.
افزایش مدت ویدیو چالش مهمی برای مدلهای مولد محسوب میشود، زیرا حفظ ظاهر شخصیتها، محیط، حرکت دوربین و ارتباط منطقی میان فریمها با طولانیترشدن ویدیو دشوارتر میشود.
علیبابا میگوید Wan 3.0 برای حفظ انسجام بصری و هویت سوژهها در طول ویدیو بهبود پیدا کرده است.
چهرههای واقعیتر و حرکات طبیعیتر
یکی از تمرکزهای اصلی توسعهدهندگان Wan 3.0 افزایش واقعگرایی انسانها در ویدیوهای تولیدشده بوده است.
مدل جدید برای بازسازی بهتر چهره، حالات صورت و جزئیات ظریف حرکتی بهینه شده و علیبابا از بهبود نمایش میکروحرکات چهره و تعامل شخصیتها با محیط خبر داده است.
این مسئله میتواند برای ساخت تبلیغات، ویدیوهای داستانی و محتوایی که شخصیت انسانی در مرکز آن قرار دارد اهمیت زیادی داشته باشد.
فقط تولید ویدیو نیست؛ Wan 3.0 قابلیت ویرایش هم دارد
Wan 3.0 بهعنوان یک مدل یکپارچه طراحی شده و چندین سناریوی تولید و ویرایش ویدیو را پوشش میدهد.
کاربران میتوانند علاوه بر تولید ویدیو از متن یا تصویر، از تصاویر و ویدیوهای دیگر بهعنوان Reference استفاده کنند تا ظاهر شخصیت، محصول یا فضای موردنظر در خروجی حفظ شود.
این مدل همچنین امکان بازتولید و اصلاح بخش مشخصی از ویدیو را فراهم میکند؛ قابلیتی که میتواند نیاز به تولید مجدد کل کلیپ را کاهش دهد.
علیبابا وارد رقابت جدی مدلهای ویدیوساز شده است
بازار تولید ویدیوی هوش مصنوعی در ماههای اخیر به یکی از رقابتیترین بخشهای صنعت AI تبدیل شده است و شرکتهایی مانند گوگل، OpenAI و Runway روی نسل جدید مدلهای ویدیویی سرمایهگذاری گستردهای انجام دادهاند.
علیبابا نیز با خانواده Wan تلاش کرده جایگاه خود را در این بازار تثبیت کند و Wan 3.0 نشان میدهد رقابت دیگر فقط بر سر کیفیت تصویر نیست؛ مدت ویدیو، انسجام شخصیتها، صدا و تنوع ورودیها نیز به معیارهای اصلی تبدیل شدهاند.
توانایی تبدیل مستقیم اسناد و فایلهای کاری به ویدیو یکی از ویژگیهایی است که Wan 3.0 را از یک مولد ویدیوی ساده به ابزاری بالقوه برای تولید محتوای حرفهای و سازمانی تبدیل میکند.
Wan 3.0 از طریق پلتفرم Alibaba Cloud Model Studio در دسترس قرار گرفته است.

