رفتن به محتوای اصلی

قابلیت Agentic Video به Gemini آمد؛ هوش مصنوعی گوگل ویدیوها را مثل انسان جستجو می‌کند

0
بدون دیدگاه اشتراک‌گذاری
تبلیغات
تبلیغات

گوگل قابلیت جدیدی با نام Agentic Video Understanding برای مدل‌های Gemini معرفی کرده است؛ فناوری جالبی که روش تحلیل ویدیو توسط هوش مصنوعی را تغییر می‌دهد. جمینای با این قابلیت دیگر مجبور نیست ویدیو را با یک نرخ ثابت فریم‌به‌فریم بررسی کند و خودش تصمیم می‌گیرد کدام قسمت‌ها را ببیند، کجا سرعت را تغییر دهد و چه زمانی سراغ صدا یا متن ویدیو برود.

تکراتو به نقل از دیجیاتو گزارش می‌دهد، این قابلیت برای مدل‌های Gemini 3.7 Flash، Gemini 3.6 Flash و Gemini 3.5 Flash-Lite عرضه شده و گوگل می‌گوید استفاده از آن علاوه‌بر افزایش دقت، مصرف توکن و هزینه تحلیل ویدیو را به‌شدت کاهش می‌دهد.

جمینای خودش تصمیم می‌گیرد چه چیزی را تماشا کند

روش معمول پردازش ویدیو توسط مدل‌های هوش مصنوعی نسبتاً ساده است. مدل ویدیو را با نرخ مشخصی نمونه‌برداری می‌کند و فریم‌های دریافت‌شده را مورد بررسی قرار می‌دهد.

در حالت پیش‌فرض پردازش Static جمینای، ویدیو با نرخ یک فریم در ثانیه پردازش می‌شود. این روش برای بسیاری از کاربردها مناسب است، اما دو مشکل مهم دارد؛ در ویدیوهای طولانی حجم بسیار زیادی توکن مصرف می‌شود و در اتفاقات بسیار سریع نیز ممکن است جزئیات مهم بین دو فریم از دست بروند.

Agentic Video Understanding این روند را تغییر می‌دهد.

جمینای ابتدا درخواست کاربر را درک می‌کند و سپس به‌صورت هدفمند در Timeline ویدیو حرکت می‌کند. مدل می‌تواند بخش‌های مختلف را جستجو کند، فریم‌ها را بررسی کند، سراغ صدای ویدیو برود یا Transcript را بخواند و فقط اطلاعات موردنیاز برای پاسخ را استخراج کند.

در واقع هوش مصنوعی دیگر یک تماشاگر منفعل نیست و خودش درباره نحوه بررسی ویدیو تصمیم می‌گیرد.

مصرف توکن تا ۸۸ درصد کاهش پیدا می‌کند

یکی از مهم‌ترین مزایای این روش کاهش چشمگیر منابع موردنیاز برای تحلیل ویدیو است.

طبق آزمایش‌های گوگل، فعال‌کردن Agentic Video Understanding می‌تواند مصرف توکن را در برخی سناریوها تا ۸۸ درصد کاهش دهد.

هزینه پردازش نیز تا ۶۶ درصد کمتر می‌شود و در عین حال دقت مدل در بنچمارک‌های تحلیل ویدیو می‌تواند تا ۷ درصد افزایش پیدا کند.

این تفاوت به‌خصوص هنگام بررسی ویدیوهای طولانی اهمیت زیادی دارد. برای مثال یک ویدیوی آموزشی ۱۰ دقیقه‌ای، سخنرانی ۹۰ دقیقه‌ای یا فایل ضبط‌شده چندساعته در روش سنتی ممکن است به پردازش حجم بزرگی از اطلاعات نیاز داشته باشد.

در روش Agentic، مدل می‌تواند ابتدا محل تقریبی اطلاعات موردنظر را پیدا کند و سپس فقط همان بخش‌ها را با جزئیات بیشتر بررسی کند.

Gemini می‌تواند یک لحظه بسیار کوتاه را پیدا کند

قابلیت جدید فقط برای کاهش هزینه طراحی نشده و در شناسایی اتفاقات سریع نیز کاربرد دارد.

گوگل می‌گوید Agentic Video Understanding می‌تواند لحظه‌هایی کوتاه‌تر از یک ثانیه را در ویدیو پیدا کند.

برای مثال اگر کاربر بخواهد دقیقاً لحظه تغییر یک وضعیت یا Cut در ویدیو را پیدا کند، جمینای می‌تواند بخش مشکوک را شناسایی کرده و سپس آن قسمت را با نرخ فریم بالاتر دوباره بررسی کند.

همین قابلیت می‌تواند برای ویرایش خودکار ویدیو، پیدا کردن صحنه‌های مشخص و تحلیل دقیق اتفاقات سریع کاربرد داشته باشد.

تشخیص اتفاقات غیرعادی و شمارش دقیق‌تر

یکی دیگر از کاربردهای مهم فناوری جدید، Anomaly Detection یا تشخیص ناهنجاری است.

فرض کنید هوش مصنوعی چند ساعت فیلم یک دوربین را بررسی می‌کند و باید یک اتفاق غیرعادی بسیار کوتاه را پیدا کند. پردازش تمام ویدیو با نرخ فریم بالا هزینه بسیار زیادی دارد.

Gemini می‌تواند ابتدا ویدیو را سریع‌تر جستجو کند و پس از پیدا کردن یک بازه زمانی مشکوک، همان چند ثانیه را با نرخ فریم بالاتر بررسی کند.

این روش برای شمارش حرکات و اشیا نیز کاربرد دارد.

در دموی منتشرشده توسط گوگل، Gemini 3.7 Flash برای شمارش یک حرکت سریع، بخش موردنظر را چند بار و با نرخ‌های فریم متفاوت بررسی می‌کند تا به پاسخ دقیق‌تری برسد.

تحلیل ویدیوهای چندساعته بسیار ارزان‌تر می‌شود

یکی از جذاب‌ترین کاربردهای Agentic Video Understanding قابلیت موسوم به Needle-in-a-Haystack است؛ یعنی پیدا کردن یک اطلاعات بسیار کوچک در میان حجم عظیمی از ویدیو.

برای مثال می‌توان یک سخنرانی چندساعته را به Gemini داد و درباره جمله یا اتفاق خاصی در آن سؤال کرد.

به‌جای اینکه مدل تمام ویدیو را با جزئیات کامل به توکن تبدیل کند، می‌تواند با استفاده از ابزارهای داخلی خود در Timeline حرکت کرده و فقط بخش‌های مرتبط را بررسی کند.

این قابلیت می‌تواند استفاده از هوش مصنوعی برای آرشیوهای ویدیویی، دوره‌های آموزشی، جلسات طولانی، محتوای رسانه‌ای و حتی سیستم‌های نظارتی را بسیار کاربردی‌تر کند.

Agentic Video همین حالا در دسترس توسعه‌دهندگان است

گوگل Agentic Video Understanding را برای Gemini 3.7 Flash، Gemini 3.6 Flash و Gemini 3.5 Flash-Lite عرضه کرده است.

این قابلیت از طریق Gemini API در Google AI Studio و Gemini Enterprise Agent Platform قابل استفاده است و هم فایل‌های ویدیویی آپلودشده و هم ویدیوهای یوتیوب را پشتیبانی می‌کند.

هزینه جداگانه‌ای نیز برای فعال‌کردن Agentic Video دریافت نمی‌شود و همان تعرفه استاندارد توکن Gemini API محاسبه خواهد شد.

گوگل همچنین اعلام کرده این فناوری به‌زودی وارد اپلیکیشن Gemini می‌شود و در ماه‌های آینده قابلیت Ask YouTube نیز از آن استفاده خواهد کرد.

Agentic Video Understanding نشان می‌دهد رقابت مدل‌های چندرسانه‌ای از صرفاً «دیدن ویدیو» عبور کرده است. حالا هدف این است که هوش مصنوعی بداند برای رسیدن به جواب، دقیقاً چه چیزی را ببیند، کدام بخش را دوباره بررسی کند و چه اطلاعاتی را اصلاً نادیده بگیرد.

دیدگاه ها و نظرات خود را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

مطالب مشابه