رفتن به محتوای اصلی

متا Muse Voice Transcribe را معرفی کرد؛ تبدیل همزمان صدای بیش از ۲۰ نفر به متن با هوش مصنوعی

0
بدون دیدگاه اشتراک‌گذاری
تبلیغات
تبلیغات

 

متا از مدل هوش مصنوعی جدیدی به نام Muse Voice Transcribe رونمایی کرده است؛ مدلی که برای تبدیل زنده گفتار به متن طراحی شده و می‌تواند در یک مکالمه طولانی، بیش از ۲۰ گوینده را از یکدیگر تشخیص دهد.

تکراتو به نقل از دیجیاتو گزارش می‌دهد، Muse Voice Transcribe اولین مدل پردازش صوتی بلادرنگ توسعه‌یافته توسط Meta Superintelligence Labs است و علاوه‌بر رونویسی زنده، قابلیت تشخیص گوینده و تشخیص زمان شروع و پایان صحبت افراد را در یک مدل واحد ارائه می‌کند.

تبدیل گفتار به متن به‌صورت لحظه‌ای

Muse Voice Transcribe برخلاف مدل‌هایی که ابتدا باید بخش بزرگی از فایل صوتی را دریافت کنند، برای پردازش Streaming طراحی شده است.

متا می‌گوید صدا در قطعات ۸۰ میلی‌ثانیه‌ای وارد مدل می‌شود و هوش مصنوعی در هر مرحله تصمیم می‌گیرد که متن را تولید کند یا برای دریافت اطلاعات بیشتر کمی صبر کند.

این سیستم از قابلیتی به نام Adaptive Delay یا «تأخیر تطبیقی» استفاده می‌کند.

به زبان ساده، اگر کلمه‌ای واضح و ساده باشد، مدل سریع‌تر آن را به متن تبدیل می‌کند؛ اما اگر کلمه پیچیده یا مبهم باشد، مدت بیشتری به ادامه صوت گوش می‌دهد تا با اطلاعات بیشتر تصمیم دقیق‌تری بگیرد.

تشخیص همزمان بیش از ۲۰ گوینده

یکی از مهم‌ترین قابلیت‌های مدل جدید متا Diarization یا تفکیک گویندگان است.

Muse Voice Transcribe می‌تواند در یک مکالمه طولانی تشخیص دهد چه زمانی گوینده تغییر کرده و بخش‌های مختلف متن را به افراد متفاوت نسبت دهد.

طبق اطلاعات رسمی متا، این سیستم می‌تواند صوت‌های طولانی بیش از یک ساعت را پردازش کند و بیش از ۲۰ گوینده را بدون نیاز به مرحله پردازشی جداگانه مدیریت کند.

این ویژگی می‌تواند Muse را برای رونویسی جلسات کاری، مصاحبه‌ها، پادکست‌ها، کلاس‌های آموزشی و مکالمات گروهی به گزینه‌ای کاربردی تبدیل کند.

بیش از ۷۰ زبان و تغییر زبان وسط جمله

متا Muse Voice Transcribe را با داده‌هایی از بیش از ۷۰ زبان آموزش داده است.

این شرکت می‌گوید در عرضه اولیه ۲۵ زبان به‌طور گسترده آزمایش و اعتبارسنجی شده‌اند و استفاده از همین زبان‌ها را در ابتدا توصیه می‌کند.

قابلیت مهم دیگر Code-Switching است.

برای مثال اگر فردی هنگام صحبت‌کردن بخشی از جمله را فارسی و بخش دیگری را انگلیسی بیان کند، مدل می‌تواند تغییر زبان را تشخیص دهد و بدون نیاز به انتخاب دستی زبان، گفتار را رونویسی کند.

Muse همچنین از Language Biasing، Keyword Biasing و Context Biasing پشتیبانی می‌کند تا توسعه‌دهندگان بتوانند با ارائه اطلاعات درباره زبان، کلمات تخصصی یا زمینه مکالمه، دقت رونویسی را افزایش دهند.

متا می‌گوید Muse در بنچمارک‌ها صدرنشین است

متا ادعا می‌کند Muse Voice Transcribe در زمان معرفی در رتبه نخست بنچمارک Artificial Analysis برای تبدیل زنده گفتار به متن قرار گرفته است.

براساس نتایج منتشرشده، نرخ خطای کلمه این مدل در آزمون انگلیسی AA-WER Streaming حدود ۳٫۱ درصد گزارش شده است.

برای مقایسه، Cartesia Ink-2 در همان ارزیابی نرخ خطای ۳٫۴ درصد، ElevenLabs Scribe v2 Real-time حدود ۳٫۶ درصد، GPT Live Transcribe حدود ۳٫۹ درصد و Gemini 3.5 Transcribe Live حدود ۴ درصد ثبت کرده‌اند.

البته این مقایسه مربوط به یک بنچمارک مشخص برای گفتار انگلیسی است و لزوماً به معنی برتری Muse در تمام زبان‌ها، لهجه‌ها و شرایط صوتی نیست.

Muse Voice Transcribe روی مک هم کار می‌کند

مدل جدید متا فقط یک پروژه تحقیقاتی نیست و از زمان معرفی در دسترس قرار گرفته است.

Muse Voice Transcribe اکنون از طریق Meta Model API، اپلیکیشن Meta AI برای مک و Muse Code قابل استفاده است.

در نسخه مک Meta AI، کاربر می‌تواند کلید Fn را نگه دارد و صدای خود را مستقیماً در برنامه‌های مختلف به متن تبدیل کند.

بنابراین قابلیت Dictation متا عملاً می‌تواند در سراسر محیط macOS مورد استفاده قرار گیرد و به یک برنامه خاص محدود نیست.

هزینه استفاده از Muse چقدر است؟

توسعه‌دهندگان نیز می‌توانند Muse Voice Transcribe را از طریق Meta Model API در محصولات خود استفاده کنند.

هزینه API در زمان عرضه ۳ دلار به‌ازای هر هزار دقیقه صوت اعلام شده است؛ یعنی تقریباً ۰٫۱۸ دلار برای یک ساعت پردازش صوت.

ورود Muse Voice Transcribe رقابت مدل‌های صوتی را داغ‌تر می‌کند. گوگل تنها چند روز قبل Gemini 3.5 Transcribe را معرفی کرده بود و حالا متا با مدلی وارد میدان شده که روی پردازش زنده، تفکیک تعداد زیادی گوینده و مکالمات چندزبانه تمرکز دارد.

اگر عملکرد واقعی Muse به نتایج بنچمارک‌ها نزدیک باشد، فناوری تبدیل گفتار به متن به‌تدریج از یک ابزار ساده برای دیکته‌کردن فراتر می‌رود و می‌تواند به زیرساخت اصلی دستیارهای صوتی، جلسات هوشمند و ایجنت‌هایی تبدیل شود که مکالمات انسانی را به‌صورت زنده درک می‌کنند.

دیدگاه ها و نظرات خود را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

مطالب مشابه