رفتن به محتوای اصلی

1. Gemini 3.5 Transcribe معرفی شد؛ هوش مصنوعی گوگل حالا حرف‌های اضافه را هم می‌فهمد

0
بدون دیدگاه اشتراک‌گذاری
تبلیغات
تبلیغات

 

گوگل از Gemini 3.5 Transcribe، مدل هوش مصنوعی جدید خود برای تبدیل حرفه‌ای گفتار به متن، رونمایی کرده است. این مدل برخلاف سیستم‌های سنتی تبدیل صدا به متن، تنها وظیفه نوشتن کلمات شنیده‌شده را برعهده ندارد و می‌تواند منظور کاربر را درک کند، مکث‌ها و کلمات اضافی را حذف کند و در نهایت متنی مرتب و خوانا تحویل دهد.

تکراتو به نقل از دیجیاتو گزارش می‌دهد، Gemini 3.5 Transcribe به‌طور تخصصی برای تبدیل گفتار به متن طراحی شده و می‌تواند بیش از ۸۵ زبان و منطقه زبانی را به‌صورت خودکار تشخیص دهد. گوگل می‌گوید مدل جدید در مقایسه با نسل قبلی خود یعنی Chirp 3، سریع‌تر و دقیق‌تر شده است.

Gemini 3.5 Transcribe مکث‌ها و کلمات اضافه را حذف می‌کند

یکی از جذاب‌ترین قابلیت‌های مدل جدید گوگل، Smart Transcription است. در این حالت هوش مصنوعی می‌تواند مواردی مانند «اِمم»، «آه»، تکرار کلمات، لکنت‌های لحظه‌ای و شروع اشتباه جمله را شناسایی و از نسخه نهایی متن حذف کند.

حتی اصلاحاتی که کاربر هنگام صحبت انجام می‌دهد نیز قابل تشخیص هستند. برای مثال اگر فردی بگوید «سه‌شنبه جلسه داریم، نه ببخشید چهارشنبه ساعت دو»، سیستم می‌تواند به‌جای ثبت تمام این جمله، نسخه نهایی را به‌شکل «چهارشنبه ساعت ۲ جلسه داریم» بنویسد.

مدل همچنین قادر است به‌صورت خودکار علائم نگارشی، پاراگراف‌بندی، فهرست‌ها، تاریخ‌ها، اعداد و مبالغ را در قالب مناسب قرار دهد. درنتیجه خروجی بیشتر شبیه یک متن ویرایش‌شده است تا پیاده‌سازی خام یک فایل صوتی.

پشتیبانی خودکار از بیش از ۸۵ زبان

Gemini 3.5 Transcribe قادر به تشخیص خودکار بیش از ۸۵ زبان و منطقه زبانی است و حتی می‌تواند تغییر زبان در میانه یک مکالمه را نیز مدیریت کند.

یکی دیگر از قابلیت‌های کاربردی آن، تعریف واژگان اختصاصی است. توسعه‌دهندگان می‌توانند تا هزار عبارت، نام، مخفف یا اصطلاح تخصصی را در اختیار مدل قرار دهند تا احتمال تشخیص صحیح کلمات خاص افزایش پیدا کند.

این ویژگی می‌تواند برای پیاده‌سازی جلسات تخصصی، محتوای پزشکی، فنی، حقوقی یا پادکست‌هایی که شامل اسامی و اصطلاحات غیرمعمول هستند کاربرد زیادی داشته باشد.

تشخیص گویندگان و ثبت زمان دقیق کلمات

مدل جدید گوگل تنها به تشخیص کلمات محدود نیست. در پردازش فایل‌های صوتی، Gemini 3.5 Transcribe قابلیت تفکیک گویندگان مختلف را نیز ارائه می‌دهد و می‌تواند مشخص کند هر بخش از مکالمه متعلق به چه کسی است.

امکان ثبت زمان شروع و پایان هر کلمه نیز وجود دارد؛ قابلیتی که برای ساخت زیرنویس، ویرایش پادکست، جست‌وجو در فایل‌های صوتی و تحلیل مکالمات کاربردی خواهد بود.

البته برخی از این امکانات بسته به حالت استفاده محدودیت‌هایی دارند. برای مثال قابلیت ثبت زمان در سطح کلمه و تفکیک گویندگان در نسخه پردازش فایل ارائه می‌شود و همه آنها در حالت استریم زنده در دسترس نیستند.

گوگل می‌گوید مدل جدید تا ۷۰ درصد سریع‌تر شده است

گوگل Gemini 3.5 Transcribe را یک جهش نسبت به Chirp 3 توصیف می‌کند. براساس داده‌های منتشرشده، زمان رسیدن از گفتار به متن نهایی در برخی ارزیابی‌ها حدود ۷۰ درصد بهبود یافته است.

در بنچمارک چندزبانه FLEURS نیز نرخ خطای کلمه مدل در حالت استریم به ۵٫۵۰ درصد و در پردازش غیرزنده به ۵٫۰۴ درصد رسیده است.

البته این اعداد مربوط به ارزیابی‌ها و شرایط آزمایشی اعلام‌شده از سوی گوگل هستند و عملکرد واقعی مدل می‌تواند بسته به زبان، کیفیت میکروفون، لهجه، نویز محیط و نوع محتوای صوتی متفاوت باشد.

Gemini 3.5 Transcribe کجا در دسترس است؟

توسعه‌دهندگان هم‌اکنون می‌توانند به نسخه Public Preview مدل Gemini 3.5 Transcribe از طریق Gemini API و Google AI Studio دسترسی داشته باشند.

گوگل همچنین این فناوری را وارد محصولات مصرفی خود کرده است. Gemini 3.5 Transcribe در قابلیت Rambler اندروید در برخی کشورها و زبان‌ها و همچنین اپلیکیشن Gemini روی macOS مورد استفاده قرار می‌گیرد.

مرورگر Chrome نیز قرار است در آینده به قابلیت‌های مبتنی‌بر این مدل مجهز شود.

با چنین امکاناتی، گوگل می‌خواهد تبدیل گفتار به متن را از یک سیستم ساده تشخیص کلمات به ابزاری تبدیل کند که صحبت‌های خام کاربر را می‌فهمد، آنها را اصلاح و مرتب می‌کند و در نهایت متنی آماده استفاده تحویل می‌دهد.

دیدگاه ها و نظرات خود را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

مطالب مشابه