در حاشیه رویداد Build 2026 رونمایی شد
MAI-Transcribe-1.5؛ مدل جدید گفتار به متن مایکروسافت
مایکروسافت مدل MAI-Transcribe-1.5 را معرفی کرد و ادعا میکند دقیقترین مدل چندزبانه تبدیل گفتار به متن (Speech-to-Text) است که در حال حاضر در میان ۴۳ زبان، کمترین نرخ خطای کلمهای (Word Error Rate - WER) را در سطح بهترینهای صنعت ارائه میدهد.
اکنون این مدل در حال یکپارچهسازی با Copilot، Teams، GitHub و Dynamics 365 Contact Centre است و همچنین در Foundry در دسترس قرار دارد؛ جایی که بهعنوان سریعترین، کارآمدترین و مقرونبهصرفهترین مدل رونویسی در میان تمامی هاپیراسکیلرها شناخته میشود.
ویژگیها و قابلیتها
- و کسب رتبه ۳ در جدول امتیازدهی Artificial Analysis و دقت در سطح مدلهای پیشرو طبق بنچمارک چندزبانه FLEURS
- پیشتاز در نسبت «دقت × سرعت» در جدول Artificial Analysis
- افزایش پوشش زبانی از ۲۵ زبان به ۴۳ زبان
- توانایی رونویسی یک ساعت صوت در کمتر از ۱۵ ثانیه؛ تا ۵ برابر سریعتر در فایلهای صوتی طولانی نسبت به Gemini 3.1، Scribe v2 و GPT-4o-Transcribe
- شامل قابلیت Keyword Biasing که مدل را نسبت به اصطلاحات دامنهمحور حساس میکند و موجب بهبود تا ۳۰ درصدی در WER روی FLEURS میشود
- بهینهسازیشده برای کاربردهای واقعی مانند پردازش صوت با پسزمینههای نویزی
دقت
مایکروسافت پوشش زبانی را با اضافهکردن ۱۸ زبان جدید گسترش داد، بدون آنکه دقت تحتتأثیر قرار گیرد. در بنچمارک استاندارد چندزبانه FLEURS، به بهترین نرخ خطای کلمهای در سطح صنعت در ۴۳ زبان دست یافت و جایگاه خود را بهعنوان دقیقترین مدل در این بنچمارک حفظ کرد.2


سرعت
مدل MAI-Transcribe-1.5 اکنون از نظر «دقت × سرعت» در جدول Artificial Analysis در جایگاه پیشرو قرار دارد و در مقایسه با مدلهای دارای دقت مشابه، تا ۵ برابر سریعتر عمل میکند. این موضوع بهویژه در پردازش فایلهای صوتی طولانی اهمیت دارد، زیرا این مدل میتواند یک ساعت صوت را در کمتر از ۱۵ ثانیه رونویسی کند.


سوگیری کلیدواژهای
یکی از چالشهای مهم در بسیاری از مدلهای رونویسی این است که در مواجهه با واژگان دامنهمحور دچار خطا میشوند؛ واژگانی که اغلب برای کاربران اهمیت حیاتی دارند. این واژگان معمولاً شامل نام افراد و محصولات، اصطلاحات پزشکی، مخففهای داخلی و واژگان اختصاصی مشتریان در سازمانها هستند.

مدل MAI-Transcribe-1.5 اکنون میتواند پیشبینیهای خود را نسبت به فهرستی از کلیدواژههای دامنهمحور که توسط کاربر ارائه میشود، بایاس کند. این مدل بهصورت کورکورانه کلیدواژهها را تحمیل نمیکند، بلکه از زمینه مشترک برای تصمیمگیری درباره زمان اعمال بایاس کلیدواژهای استفاده میکند. این قابلیت به طور قابلتوجهی دقت تشخیص واژگان تخصصی را افزایش میدهد درحالیکه دقت در گفتار عمومی حفظ میشود.
در استفاده از بایاسگذاری کلیدواژهای، کاهش ۳۰ درصدی در نرخ خطای کلمهای (WER) در بنچمارک چندزبانه FLEURS مشاهده شده است.
مراحل بعدی
- Diarization: قابلیت تشخیص اینکه چه کسی چه چیزی گفته در صوت چندگوینده؛ ضروری برای جلسات، مصاحبهها و تحلیل مراکز تماس
- Native Streaming API: امکان رونویسی بلادرنگ برای کاربردهای زنده و عاملهای صوتی، فراتر از رویکرد فعلی مبتنی بر پردازش دستهای (batch-first)
- گسترش پشتیبانی زبانی: ارائه همان سطح از دقت و استحکام برای هر زبان جدید، مشابه ۴۳ زبان فعلی

مدل MAI-Transcribe-1.5 هماکنون در MAI Playground دردسترس است. اطلاعات بیشتر درباره MAI-Transcribe-1.5