در حاشیه رویداد Build 2026 رونمایی شد
MAI-Voice-2؛ مدل جدید متن به گفتار مایکروسافت
مایکروسافت از جدیدترین طبیعیترین و بیانگرترین مدل تبدیل متن به گفتار (Text-to-Speech) خود به نام MAI-Voice-2 رونمایی کرد.
این مدل در تمام ابعاد کلیدی که برای تجربههای صوتی اهمیت دارند، نسبت به نسل قبلی خود یک جهش معنادار ایجاد کرده است؛ ازجمله وفاداری صوتی (fidelity)، پوشش زبانی، ثبات گوینده و گستره احساسی. این مدل برای محصولات و سرویسهایی طراحی شده است که کیفیت صدا در آنها مستقیماً بر تجربه کاربر اثر میگذارد؛ مانند دستیارهایی یا پشتیبانی مشتری که نماینده برند شما هستند، کتابهای صوتی که باید برای ساعتها توجه شنونده را حفظ کنند و تجربههای دسترسپذیری که در آنها صدا تنها رابط کاربری است.
قابلیتها و ویژگیها
- گسترش از حالت فقط انگلیسی به ۱۵ زبان، درحالیکه همان سطح طبیعیبودن و بیانگری زبان انگلیسی حفظ شده است.
- کنترل جزئینگر احساسات از طریق تگهای احساسی؛ غمگین (sad)، نجواگونه (whispered)، هیجانزده (excited) و موارد مشابه.
- پرامپتسازی صدای zero-shot با استفاده از ۵ تا ۶۰ ثانیه صوت مرجع در تمام زبانهای پشتیبانیشده همراه با سازوکارهای داخلی کنترل رضایت.
- MAI-Voice-2 در ۷۲ درصد مواقع نسبت به نسل قبلی خود MAI-Voice-1 ترجیح داده شده است.
- ثبات هویت گوینده در محتوای بلندمدت؛ شامل کتابهای صوتی، پادکستها و سخنرانیها.
- قابلیت code-switching برای برخی جفتزبانها مانند هندی-انگلیسی و اسپانیایی-انگلیسی مطابق با نحوه طبیعی ترکیب زبانها توسط کاربران در گفتار روزمره.
همچنین این مدل با درنظرگرفتن استقرار مسئولانه ساخته شده است؛ با سازوکارهای حفاظتی مبتنی بر رضایت (consent guardrails) که تضمین میکنند این فناوری به همان اندازه که طبیعی به نظر میرسد، قابلاعتماد نیز باشد. MAI-Voice-2 اکنون در Azure Foundry در دسترس است و در حال یکپارچهسازی با VSCode و مرکز تماس Dynamics 365 است.
عملکرد
MAI-Voice-2 قادر است گفتار بسیار طبیعی را به شیوهای قابلکنترل تولید کند. در آزمونهای ترجیح مقایسهای، این مدل در ۷۲ درصد مواقع نسبت به نسلهای قبلی برتری داشته است. در ارزیابیهای شباهت گوینده، صدای تولیدشده توسط MAI-Voice-2 از صدای ضبطشده همان گوینده غیرقابلتمایز است.

نمودار میلهای نشان میدهد که به طور میانگین در ۱۱ زبان، ۴۵.۵ درصد از شنوندگان صدای تولیدشده توسط MAI-Voice-2 را ترجیح دادهاند، ۴۴ درصد صدای ضبطشده انسانی را ترجیح دادهاند، و ۱۰.۵ درصد نیز نتیجه را برابر دانستهاند. (بر اساس ۲,۲۲۲ پاسخ)
زبانهای پشتیبانیشده
مایکروسافت تمرکز خود را بر ۱۵ زبان قرار دادهاست و اطمینان حاصل کرده که برای زبانهای پشتیبانیشده، طیفی از قابلیتهای بیانی شامل سیستمهای آهنگین (tonal)، لهجهدار (pitch accent)، وزن-زمانی (stress-timed) و هجا-زمانی (syllable-timed) پوشش داده شود.
MAI-Voice-2 اکنون از زبانها/لهجههای زیر پشتیبانی میکند: انگلیسی (آمریکا)، انگلیسی (استرالیا)، ایتالیایی، فرانسوی، آلمانی، هندی، اسپانیایی (اسپانیا)، اسپانیایی (مکزیک)، پرتغالی (برزیل)، پرتغالی (پرتغال)، کرهای، چینی (سادهشده)، ترکی، روسی، تایلندی، هلندی، رومانیایی و مجارستانی.
در شرایطی که افراد به طور طبیعی زبانها را با هم ترکیب میکنند، مایکروسافت از قابلیت کد-سوئیچینگ نیز پشتیبانی میکند که بازتابدهنده نحوه واقعی صحبتکردن افراد است. در آزمایشهای داخلی، مدل قادر است بدون ازدستدادن طبیعیبودن آهنگ گفتار (prosodic naturalness) یا هویت گوینده، بهصورت روان در میانه جمله بین زبانها جابهجا شود.

سنتز صوتی
توسعهدهندگان میتوانند یک صدای سفارشی در Microsoft Foundry در تمام زبانهای پشتیبانیشده ایجاد کنند؛ تنها با استفاده از یک کلیپ مرجع کوتاه بدون نیاز به بازآموزی (retraining) یا تنظیم دقیق (fine-tuning). با تنها چند ثانیه صوت (توصیهشده: ۵ تا ۶۰ ثانیه)، MAI Voice 2 میتواند گفتار با کیفیت بالا تولید کند که هویت گوینده را بازتولید میکند؛ این موضوع باعث میشود شرکتها بتوانند بهسادگی صدای برند خود را در محصولات وارد کنند، بدون آنکه نیاز به نگهداری یک مدل صوتی جداگانه داشته باشند.
رضایت در سطح سیستم اعمال میشود. تنها صداهای مجاز و دارای مجوز و لایسنسشده میتوانند در محیط تولید سنتز شوند. هیچگونه شبیهسازی و ویس کلونینگ صدای بدون مجوز امکانپذیر نیست.
- میتوانید مدلهای MAI-Voice-2 را مستقیماً در MAI Playground امتحان کنید.
- Model card
- Foundry API documentation
- Cookbook