متا از مدل هوش مصنوعی جدیدی به نام Muse Voice Transcribe رونمایی کرده است؛ مدلی که برای تبدیل زنده گفتار به متن طراحی شده و میتواند در یک مکالمه طولانی، بیش از ۲۰ گوینده را از یکدیگر تشخیص دهد.
تکراتو به نقل از دیجیاتو گزارش میدهد، Muse Voice Transcribe اولین مدل پردازش صوتی بلادرنگ توسعهیافته توسط Meta Superintelligence Labs است و علاوهبر رونویسی زنده، قابلیت تشخیص گوینده و تشخیص زمان شروع و پایان صحبت افراد را در یک مدل واحد ارائه میکند.
تبدیل گفتار به متن بهصورت لحظهای
Muse Voice Transcribe برخلاف مدلهایی که ابتدا باید بخش بزرگی از فایل صوتی را دریافت کنند، برای پردازش Streaming طراحی شده است.
متا میگوید صدا در قطعات ۸۰ میلیثانیهای وارد مدل میشود و هوش مصنوعی در هر مرحله تصمیم میگیرد که متن را تولید کند یا برای دریافت اطلاعات بیشتر کمی صبر کند.
این سیستم از قابلیتی به نام Adaptive Delay یا «تأخیر تطبیقی» استفاده میکند.
به زبان ساده، اگر کلمهای واضح و ساده باشد، مدل سریعتر آن را به متن تبدیل میکند؛ اما اگر کلمه پیچیده یا مبهم باشد، مدت بیشتری به ادامه صوت گوش میدهد تا با اطلاعات بیشتر تصمیم دقیقتری بگیرد.
تشخیص همزمان بیش از ۲۰ گوینده
یکی از مهمترین قابلیتهای مدل جدید متا Diarization یا تفکیک گویندگان است.
Muse Voice Transcribe میتواند در یک مکالمه طولانی تشخیص دهد چه زمانی گوینده تغییر کرده و بخشهای مختلف متن را به افراد متفاوت نسبت دهد.
طبق اطلاعات رسمی متا، این سیستم میتواند صوتهای طولانی بیش از یک ساعت را پردازش کند و بیش از ۲۰ گوینده را بدون نیاز به مرحله پردازشی جداگانه مدیریت کند.
این ویژگی میتواند Muse را برای رونویسی جلسات کاری، مصاحبهها، پادکستها، کلاسهای آموزشی و مکالمات گروهی به گزینهای کاربردی تبدیل کند.
بیش از ۷۰ زبان و تغییر زبان وسط جمله
متا Muse Voice Transcribe را با دادههایی از بیش از ۷۰ زبان آموزش داده است.
این شرکت میگوید در عرضه اولیه ۲۵ زبان بهطور گسترده آزمایش و اعتبارسنجی شدهاند و استفاده از همین زبانها را در ابتدا توصیه میکند.
قابلیت مهم دیگر Code-Switching است.
برای مثال اگر فردی هنگام صحبتکردن بخشی از جمله را فارسی و بخش دیگری را انگلیسی بیان کند، مدل میتواند تغییر زبان را تشخیص دهد و بدون نیاز به انتخاب دستی زبان، گفتار را رونویسی کند.
Muse همچنین از Language Biasing، Keyword Biasing و Context Biasing پشتیبانی میکند تا توسعهدهندگان بتوانند با ارائه اطلاعات درباره زبان، کلمات تخصصی یا زمینه مکالمه، دقت رونویسی را افزایش دهند.
متا میگوید Muse در بنچمارکها صدرنشین است
متا ادعا میکند Muse Voice Transcribe در زمان معرفی در رتبه نخست بنچمارک Artificial Analysis برای تبدیل زنده گفتار به متن قرار گرفته است.
براساس نتایج منتشرشده، نرخ خطای کلمه این مدل در آزمون انگلیسی AA-WER Streaming حدود ۳٫۱ درصد گزارش شده است.
برای مقایسه، Cartesia Ink-2 در همان ارزیابی نرخ خطای ۳٫۴ درصد، ElevenLabs Scribe v2 Real-time حدود ۳٫۶ درصد، GPT Live Transcribe حدود ۳٫۹ درصد و Gemini 3.5 Transcribe Live حدود ۴ درصد ثبت کردهاند.
البته این مقایسه مربوط به یک بنچمارک مشخص برای گفتار انگلیسی است و لزوماً به معنی برتری Muse در تمام زبانها، لهجهها و شرایط صوتی نیست.
Muse Voice Transcribe روی مک هم کار میکند
مدل جدید متا فقط یک پروژه تحقیقاتی نیست و از زمان معرفی در دسترس قرار گرفته است.
Muse Voice Transcribe اکنون از طریق Meta Model API، اپلیکیشن Meta AI برای مک و Muse Code قابل استفاده است.
در نسخه مک Meta AI، کاربر میتواند کلید Fn را نگه دارد و صدای خود را مستقیماً در برنامههای مختلف به متن تبدیل کند.
بنابراین قابلیت Dictation متا عملاً میتواند در سراسر محیط macOS مورد استفاده قرار گیرد و به یک برنامه خاص محدود نیست.
هزینه استفاده از Muse چقدر است؟
توسعهدهندگان نیز میتوانند Muse Voice Transcribe را از طریق Meta Model API در محصولات خود استفاده کنند.
هزینه API در زمان عرضه ۳ دلار بهازای هر هزار دقیقه صوت اعلام شده است؛ یعنی تقریباً ۰٫۱۸ دلار برای یک ساعت پردازش صوت.
ورود Muse Voice Transcribe رقابت مدلهای صوتی را داغتر میکند. گوگل تنها چند روز قبل Gemini 3.5 Transcribe را معرفی کرده بود و حالا متا با مدلی وارد میدان شده که روی پردازش زنده، تفکیک تعداد زیادی گوینده و مکالمات چندزبانه تمرکز دارد.
اگر عملکرد واقعی Muse به نتایج بنچمارکها نزدیک باشد، فناوری تبدیل گفتار به متن بهتدریج از یک ابزار ساده برای دیکتهکردن فراتر میرود و میتواند به زیرساخت اصلی دستیارهای صوتی، جلسات هوشمند و ایجنتهایی تبدیل شود که مکالمات انسانی را بهصورت زنده درک میکنند.

