رفتن به محتوای اصلی

هوش مصنوعی جدید علی‌بابا پاورپوینت و PDF را هم به ویدیو تبدیل می‌کند

0
بدون دیدگاه اشتراک‌گذاری
تبلیغات
تبلیغات

علی‌بابا نسل جدید مدل هوش مصنوعی تولید ویدیو خود با نام Wan 3.0 را معرفی کرده است؛ مدلی که می‌تواند در یک مرحله ویدیوهایی تا ۳۰ ثانیه تولید کند و برخلاف بسیاری از رقبای خود، تنها به پرامپت متنی یا تصویر محدود نیست.

Wan 3.0 می‌تواند متن، تصویر، فایل صوتی، ویدیو و حتی اسنادی مانند PDF، PowerPoint، Word و Excel را به‌عنوان ورودی دریافت کند. به این ترتیب، کاربر می‌تواند برای مثال یک فایل ارائه یا سند را در اختیار مدل قرار دهد و از هوش مصنوعی بخواهد محتوای آن را به یک ویدیوی منسجم تبدیل کند.

از PDF و پاورپوینت تا ویدیوی هوش مصنوعی

یکی از مهم‌ترین قابلیت‌های Wan 3.0 پشتیبانی از ورودی‌های چندوجهی است.

علی‌بابا می‌گوید مدل جدید می‌تواند اطلاعات موجود در اسناد متنی و فایل‌های مختلف را درک کرده و آنها را به محتوای ویدیویی تبدیل کند.

این قابلیت می‌تواند کاربرد Wan 3.0 را فراتر از ساخت کلیپ‌های سرگرم‌کننده ببرد. برای مثال، یک کسب‌وکار می‌تواند از اسناد معرفی محصول، گزارش‌ها یا فایل‌های ارائه برای تولید سریع محتوای ویدیویی استفاده کند.

ساخت ویدیوی ۳۰ ثانیه‌ای در یک مرحله

یکی دیگر از پیشرفت‌های مهم Wan 3.0 افزایش مدت ویدیوهای تولیدشده است.

این مدل می‌تواند کلیپ‌هایی با حداکثر مدت ۳۰ ثانیه را در یک مرحله تولید کند؛ بدون اینکه لازم باشد چند کلیپ کوتاه‌تر به یکدیگر متصل شوند.

افزایش مدت ویدیو چالش مهمی برای مدل‌های مولد محسوب می‌شود، زیرا حفظ ظاهر شخصیت‌ها، محیط، حرکت دوربین و ارتباط منطقی میان فریم‌ها با طولانی‌ترشدن ویدیو دشوارتر می‌شود.

علی‌بابا می‌گوید Wan 3.0 برای حفظ انسجام بصری و هویت سوژه‌ها در طول ویدیو بهبود پیدا کرده است.

چهره‌های واقعی‌تر و حرکات طبیعی‌تر

یکی از تمرکزهای اصلی توسعه‌دهندگان Wan 3.0 افزایش واقع‌گرایی انسان‌ها در ویدیوهای تولیدشده بوده است.

مدل جدید برای بازسازی بهتر چهره، حالات صورت و جزئیات ظریف حرکتی بهینه شده و علی‌بابا از بهبود نمایش میکروحرکات چهره و تعامل شخصیت‌ها با محیط خبر داده است.

این مسئله می‌تواند برای ساخت تبلیغات، ویدیوهای داستانی و محتوایی که شخصیت انسانی در مرکز آن قرار دارد اهمیت زیادی داشته باشد.

فقط تولید ویدیو نیست؛ Wan 3.0 قابلیت ویرایش هم دارد

Wan 3.0 به‌عنوان یک مدل یکپارچه طراحی شده و چندین سناریوی تولید و ویرایش ویدیو را پوشش می‌دهد.

کاربران می‌توانند علاوه بر تولید ویدیو از متن یا تصویر، از تصاویر و ویدیوهای دیگر به‌عنوان Reference استفاده کنند تا ظاهر شخصیت، محصول یا فضای موردنظر در خروجی حفظ شود.

این مدل همچنین امکان بازتولید و اصلاح بخش مشخصی از ویدیو را فراهم می‌کند؛ قابلیتی که می‌تواند نیاز به تولید مجدد کل کلیپ را کاهش دهد.

علی‌بابا وارد رقابت جدی مدل‌های ویدیوساز شده است

بازار تولید ویدیوی هوش مصنوعی در ماه‌های اخیر به یکی از رقابتی‌ترین بخش‌های صنعت AI تبدیل شده است و شرکت‌هایی مانند گوگل، OpenAI و Runway روی نسل جدید مدل‌های ویدیویی سرمایه‌گذاری گسترده‌ای انجام داده‌اند.

علی‌بابا نیز با خانواده Wan تلاش کرده جایگاه خود را در این بازار تثبیت کند و Wan 3.0 نشان می‌دهد رقابت دیگر فقط بر سر کیفیت تصویر نیست؛ مدت ویدیو، انسجام شخصیت‌ها، صدا و تنوع ورودی‌ها نیز به معیارهای اصلی تبدیل شده‌اند.

توانایی تبدیل مستقیم اسناد و فایل‌های کاری به ویدیو یکی از ویژگی‌هایی است که Wan 3.0 را از یک مولد ویدیوی ساده به ابزاری بالقوه برای تولید محتوای حرفه‌ای و سازمانی تبدیل می‌کند.

Wan 3.0 از طریق پلتفرم Alibaba Cloud Model Studio در دسترس قرار گرفته است.

دیدگاه ها و نظرات خود را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

مطالب مشابه