گوگل قابلیت جدیدی با نام Agentic Video Understanding برای مدلهای Gemini معرفی کرده است؛ فناوری جالبی که روش تحلیل ویدیو توسط هوش مصنوعی را تغییر میدهد. جمینای با این قابلیت دیگر مجبور نیست ویدیو را با یک نرخ ثابت فریمبهفریم بررسی کند و خودش تصمیم میگیرد کدام قسمتها را ببیند، کجا سرعت را تغییر دهد و چه زمانی سراغ صدا یا متن ویدیو برود.
تکراتو به نقل از دیجیاتو گزارش میدهد، این قابلیت برای مدلهای Gemini 3.7 Flash، Gemini 3.6 Flash و Gemini 3.5 Flash-Lite عرضه شده و گوگل میگوید استفاده از آن علاوهبر افزایش دقت، مصرف توکن و هزینه تحلیل ویدیو را بهشدت کاهش میدهد.
جمینای خودش تصمیم میگیرد چه چیزی را تماشا کند
روش معمول پردازش ویدیو توسط مدلهای هوش مصنوعی نسبتاً ساده است. مدل ویدیو را با نرخ مشخصی نمونهبرداری میکند و فریمهای دریافتشده را مورد بررسی قرار میدهد.
در حالت پیشفرض پردازش Static جمینای، ویدیو با نرخ یک فریم در ثانیه پردازش میشود. این روش برای بسیاری از کاربردها مناسب است، اما دو مشکل مهم دارد؛ در ویدیوهای طولانی حجم بسیار زیادی توکن مصرف میشود و در اتفاقات بسیار سریع نیز ممکن است جزئیات مهم بین دو فریم از دست بروند.
Agentic Video Understanding این روند را تغییر میدهد.
جمینای ابتدا درخواست کاربر را درک میکند و سپس بهصورت هدفمند در Timeline ویدیو حرکت میکند. مدل میتواند بخشهای مختلف را جستجو کند، فریمها را بررسی کند، سراغ صدای ویدیو برود یا Transcript را بخواند و فقط اطلاعات موردنیاز برای پاسخ را استخراج کند.
در واقع هوش مصنوعی دیگر یک تماشاگر منفعل نیست و خودش درباره نحوه بررسی ویدیو تصمیم میگیرد.
مصرف توکن تا ۸۸ درصد کاهش پیدا میکند
یکی از مهمترین مزایای این روش کاهش چشمگیر منابع موردنیاز برای تحلیل ویدیو است.
طبق آزمایشهای گوگل، فعالکردن Agentic Video Understanding میتواند مصرف توکن را در برخی سناریوها تا ۸۸ درصد کاهش دهد.
هزینه پردازش نیز تا ۶۶ درصد کمتر میشود و در عین حال دقت مدل در بنچمارکهای تحلیل ویدیو میتواند تا ۷ درصد افزایش پیدا کند.
این تفاوت بهخصوص هنگام بررسی ویدیوهای طولانی اهمیت زیادی دارد. برای مثال یک ویدیوی آموزشی ۱۰ دقیقهای، سخنرانی ۹۰ دقیقهای یا فایل ضبطشده چندساعته در روش سنتی ممکن است به پردازش حجم بزرگی از اطلاعات نیاز داشته باشد.
در روش Agentic، مدل میتواند ابتدا محل تقریبی اطلاعات موردنظر را پیدا کند و سپس فقط همان بخشها را با جزئیات بیشتر بررسی کند.
Gemini میتواند یک لحظه بسیار کوتاه را پیدا کند
قابلیت جدید فقط برای کاهش هزینه طراحی نشده و در شناسایی اتفاقات سریع نیز کاربرد دارد.
گوگل میگوید Agentic Video Understanding میتواند لحظههایی کوتاهتر از یک ثانیه را در ویدیو پیدا کند.
برای مثال اگر کاربر بخواهد دقیقاً لحظه تغییر یک وضعیت یا Cut در ویدیو را پیدا کند، جمینای میتواند بخش مشکوک را شناسایی کرده و سپس آن قسمت را با نرخ فریم بالاتر دوباره بررسی کند.
همین قابلیت میتواند برای ویرایش خودکار ویدیو، پیدا کردن صحنههای مشخص و تحلیل دقیق اتفاقات سریع کاربرد داشته باشد.
تشخیص اتفاقات غیرعادی و شمارش دقیقتر
یکی دیگر از کاربردهای مهم فناوری جدید، Anomaly Detection یا تشخیص ناهنجاری است.
فرض کنید هوش مصنوعی چند ساعت فیلم یک دوربین را بررسی میکند و باید یک اتفاق غیرعادی بسیار کوتاه را پیدا کند. پردازش تمام ویدیو با نرخ فریم بالا هزینه بسیار زیادی دارد.
Gemini میتواند ابتدا ویدیو را سریعتر جستجو کند و پس از پیدا کردن یک بازه زمانی مشکوک، همان چند ثانیه را با نرخ فریم بالاتر بررسی کند.
این روش برای شمارش حرکات و اشیا نیز کاربرد دارد.
در دموی منتشرشده توسط گوگل، Gemini 3.7 Flash برای شمارش یک حرکت سریع، بخش موردنظر را چند بار و با نرخهای فریم متفاوت بررسی میکند تا به پاسخ دقیقتری برسد.
تحلیل ویدیوهای چندساعته بسیار ارزانتر میشود
یکی از جذابترین کاربردهای Agentic Video Understanding قابلیت موسوم به Needle-in-a-Haystack است؛ یعنی پیدا کردن یک اطلاعات بسیار کوچک در میان حجم عظیمی از ویدیو.
برای مثال میتوان یک سخنرانی چندساعته را به Gemini داد و درباره جمله یا اتفاق خاصی در آن سؤال کرد.
بهجای اینکه مدل تمام ویدیو را با جزئیات کامل به توکن تبدیل کند، میتواند با استفاده از ابزارهای داخلی خود در Timeline حرکت کرده و فقط بخشهای مرتبط را بررسی کند.
این قابلیت میتواند استفاده از هوش مصنوعی برای آرشیوهای ویدیویی، دورههای آموزشی، جلسات طولانی، محتوای رسانهای و حتی سیستمهای نظارتی را بسیار کاربردیتر کند.
Agentic Video همین حالا در دسترس توسعهدهندگان است
گوگل Agentic Video Understanding را برای Gemini 3.7 Flash، Gemini 3.6 Flash و Gemini 3.5 Flash-Lite عرضه کرده است.
این قابلیت از طریق Gemini API در Google AI Studio و Gemini Enterprise Agent Platform قابل استفاده است و هم فایلهای ویدیویی آپلودشده و هم ویدیوهای یوتیوب را پشتیبانی میکند.
هزینه جداگانهای نیز برای فعالکردن Agentic Video دریافت نمیشود و همان تعرفه استاندارد توکن Gemini API محاسبه خواهد شد.
گوگل همچنین اعلام کرده این فناوری بهزودی وارد اپلیکیشن Gemini میشود و در ماههای آینده قابلیت Ask YouTube نیز از آن استفاده خواهد کرد.
Agentic Video Understanding نشان میدهد رقابت مدلهای چندرسانهای از صرفاً «دیدن ویدیو» عبور کرده است. حالا هدف این است که هوش مصنوعی بداند برای رسیدن به جواب، دقیقاً چه چیزی را ببیند، کدام بخش را دوباره بررسی کند و چه اطلاعاتی را اصلاً نادیده بگیرد.

