گوگل از Gemini 3.5 Transcribe، مدل هوش مصنوعی جدید خود برای تبدیل حرفهای گفتار به متن، رونمایی کرده است. این مدل برخلاف سیستمهای سنتی تبدیل صدا به متن، تنها وظیفه نوشتن کلمات شنیدهشده را برعهده ندارد و میتواند منظور کاربر را درک کند، مکثها و کلمات اضافی را حذف کند و در نهایت متنی مرتب و خوانا تحویل دهد.
تکراتو به نقل از دیجیاتو گزارش میدهد، Gemini 3.5 Transcribe بهطور تخصصی برای تبدیل گفتار به متن طراحی شده و میتواند بیش از ۸۵ زبان و منطقه زبانی را بهصورت خودکار تشخیص دهد. گوگل میگوید مدل جدید در مقایسه با نسل قبلی خود یعنی Chirp 3، سریعتر و دقیقتر شده است.
Gemini 3.5 Transcribe مکثها و کلمات اضافه را حذف میکند
یکی از جذابترین قابلیتهای مدل جدید گوگل، Smart Transcription است. در این حالت هوش مصنوعی میتواند مواردی مانند «اِمم»، «آه»، تکرار کلمات، لکنتهای لحظهای و شروع اشتباه جمله را شناسایی و از نسخه نهایی متن حذف کند.
حتی اصلاحاتی که کاربر هنگام صحبت انجام میدهد نیز قابل تشخیص هستند. برای مثال اگر فردی بگوید «سهشنبه جلسه داریم، نه ببخشید چهارشنبه ساعت دو»، سیستم میتواند بهجای ثبت تمام این جمله، نسخه نهایی را بهشکل «چهارشنبه ساعت ۲ جلسه داریم» بنویسد.
مدل همچنین قادر است بهصورت خودکار علائم نگارشی، پاراگرافبندی، فهرستها، تاریخها، اعداد و مبالغ را در قالب مناسب قرار دهد. درنتیجه خروجی بیشتر شبیه یک متن ویرایششده است تا پیادهسازی خام یک فایل صوتی.
پشتیبانی خودکار از بیش از ۸۵ زبان
Gemini 3.5 Transcribe قادر به تشخیص خودکار بیش از ۸۵ زبان و منطقه زبانی است و حتی میتواند تغییر زبان در میانه یک مکالمه را نیز مدیریت کند.
یکی دیگر از قابلیتهای کاربردی آن، تعریف واژگان اختصاصی است. توسعهدهندگان میتوانند تا هزار عبارت، نام، مخفف یا اصطلاح تخصصی را در اختیار مدل قرار دهند تا احتمال تشخیص صحیح کلمات خاص افزایش پیدا کند.
این ویژگی میتواند برای پیادهسازی جلسات تخصصی، محتوای پزشکی، فنی، حقوقی یا پادکستهایی که شامل اسامی و اصطلاحات غیرمعمول هستند کاربرد زیادی داشته باشد.
تشخیص گویندگان و ثبت زمان دقیق کلمات
مدل جدید گوگل تنها به تشخیص کلمات محدود نیست. در پردازش فایلهای صوتی، Gemini 3.5 Transcribe قابلیت تفکیک گویندگان مختلف را نیز ارائه میدهد و میتواند مشخص کند هر بخش از مکالمه متعلق به چه کسی است.
امکان ثبت زمان شروع و پایان هر کلمه نیز وجود دارد؛ قابلیتی که برای ساخت زیرنویس، ویرایش پادکست، جستوجو در فایلهای صوتی و تحلیل مکالمات کاربردی خواهد بود.
البته برخی از این امکانات بسته به حالت استفاده محدودیتهایی دارند. برای مثال قابلیت ثبت زمان در سطح کلمه و تفکیک گویندگان در نسخه پردازش فایل ارائه میشود و همه آنها در حالت استریم زنده در دسترس نیستند.
گوگل میگوید مدل جدید تا ۷۰ درصد سریعتر شده است
گوگل Gemini 3.5 Transcribe را یک جهش نسبت به Chirp 3 توصیف میکند. براساس دادههای منتشرشده، زمان رسیدن از گفتار به متن نهایی در برخی ارزیابیها حدود ۷۰ درصد بهبود یافته است.
در بنچمارک چندزبانه FLEURS نیز نرخ خطای کلمه مدل در حالت استریم به ۵٫۵۰ درصد و در پردازش غیرزنده به ۵٫۰۴ درصد رسیده است.
البته این اعداد مربوط به ارزیابیها و شرایط آزمایشی اعلامشده از سوی گوگل هستند و عملکرد واقعی مدل میتواند بسته به زبان، کیفیت میکروفون، لهجه، نویز محیط و نوع محتوای صوتی متفاوت باشد.
Gemini 3.5 Transcribe کجا در دسترس است؟
توسعهدهندگان هماکنون میتوانند به نسخه Public Preview مدل Gemini 3.5 Transcribe از طریق Gemini API و Google AI Studio دسترسی داشته باشند.
گوگل همچنین این فناوری را وارد محصولات مصرفی خود کرده است. Gemini 3.5 Transcribe در قابلیت Rambler اندروید در برخی کشورها و زبانها و همچنین اپلیکیشن Gemini روی macOS مورد استفاده قرار میگیرد.
مرورگر Chrome نیز قرار است در آینده به قابلیتهای مبتنیبر این مدل مجهز شود.
با چنین امکاناتی، گوگل میخواهد تبدیل گفتار به متن را از یک سیستم ساده تشخیص کلمات به ابزاری تبدیل کند که صحبتهای خام کاربر را میفهمد، آنها را اصلاح و مرتب میکند و در نهایت متنی آماده استفاده تحویل میدهد.

