جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 MAI-Voice-2؛ مدل جدید متن به گفتار مایکروسافت

در حاشیه رویداد Build 2026 رونمایی شد

MAI-Voice-2؛ مدل جدید متن به گفتار مایکروسافت

زمان مطالعه: 3 دقیقه

مایکروسافت از جدیدترین طبیعی‌ترین و بیان‌گرترین مدل تبدیل متن به گفتار (Text-to-Speech)  خود به نام MAI-Voice-2 رونمایی کرد.

این مدل در تمام ابعاد کلیدی که برای تجربه‌های صوتی اهمیت دارند، نسبت به نسل قبلی خود یک جهش معنادار ایجاد کرده است؛ ازجمله وفاداری صوتی (fidelity)، پوشش زبانی، ثبات گوینده و گستره احساسی. این مدل برای محصولات و سرویس‌هایی طراحی شده است که کیفیت صدا در آن‌ها مستقیماً بر تجربه کاربر اثر می‌گذارد؛ مانند دستیارهایی یا پشتیبانی مشتری که نماینده برند شما هستند، کتاب‌های صوتی که باید برای ساعت‌ها توجه شنونده را حفظ کنند و تجربه‌های دسترس‌پذیری که در آن‌ها صدا تنها رابط کاربری است.

قابلیت‌ها و ویژگی‌ها

  • گسترش از حالت فقط انگلیسی به ۱۵ زبان، درحالی‌که همان سطح طبیعی‌بودن و بیان‌گری زبان انگلیسی حفظ شده است.
  • کنترل جزئی‌نگر احساسات از طریق تگ‌های احساسی؛ غمگین (sad)، نجواگونه (whispered)، هیجان‌زده (excited) و موارد مشابه.
  • پرامپت‌سازی صدای zero-shot با استفاده از ۵ تا ۶۰ ثانیه صوت مرجع در تمام زبان‌های پشتیبانی‌شده همراه با سازوکارهای داخلی کنترل رضایت.
  • MAI-Voice-2 در ۷۲ درصد  مواقع نسبت به نسل قبلی خود MAI-Voice-1 ترجیح داده شده است.
  • ثبات هویت گوینده در محتوای بلندمدت؛ شامل کتاب‌های صوتی، پادکست‌ها و سخنرانی‌ها.
  • قابلیت code-switching برای برخی جفت‌زبان‌ها مانند هندی-انگلیسی و اسپانیایی-انگلیسی مطابق با نحوه طبیعی ترکیب زبان‌ها توسط کاربران در گفتار روزمره.

همچنین این مدل با درنظرگرفتن استقرار مسئولانه ساخته شده است؛ با سازوکارهای حفاظتی مبتنی بر رضایت (consent guardrails) که تضمین می‌کنند این فناوری به همان اندازه که طبیعی به نظر می‌رسد، قابل‌اعتماد نیز باشد. MAI-Voice-2 اکنون در Azure Foundry در دسترس است و در حال یکپارچه‌سازی با VSCode و مرکز تماس Dynamics 365 است.

عملکرد

MAI-Voice-2 قادر است گفتار بسیار طبیعی را به شیوه‌ای قابل‌کنترل تولید کند. در آزمون‌های ترجیح مقایسه‌ای، این مدل در ۷۲ درصد مواقع نسبت به نسل‌های قبلی برتری داشته است. در ارزیابی‌های شباهت گوینده، صدای تولیدشده توسط MAI-Voice-2 از صدای ضبط‌شده همان گوینده غیرقابل‌تمایز است.

نمودار میله‌ای نرخ پیروزی MAI-Voice-2 با ۷۲.۱ درصد در ارزیابی کیفیت کلی بر اساس ۲,۵۰۰ آزمون شنیداری

نمودار میله‌ای نشان می‌دهد که به طور میانگین در ۱۱ زبان، ۴۵.۵ درصد از شنوندگان صدای تولیدشده توسط MAI-Voice-2 را ترجیح داده‌اند، ۴۴ درصد صدای ضبط‌شده انسانی را ترجیح داده‌اند، و ۱۰.۵ درصد نیز نتیجه را برابر دانسته‌اند. (بر اساس ۲,۲۲۲ پاسخ)

زبان‌های پشتیبانی‌شده

مایکروسافت تمرکز خود را بر ۱۵ زبان قرار داده‌است و اطمینان حاصل کرده که برای زبان‌های پشتیبانی‌شده، طیفی از قابلیت‌های بیانی شامل سیستم‌های آهنگین (tonal)، لهجه‌دار (pitch accent)، وزن-زمانی (stress-timed) و هجا-زمانی (syllable-timed) پوشش داده شود.

MAI-Voice-2 اکنون از زبان‌ها/لهجه‌های زیر پشتیبانی می‌کند: انگلیسی (آمریکا)، انگلیسی (استرالیا)، ایتالیایی، فرانسوی، آلمانی، هندی، اسپانیایی (اسپانیا)، اسپانیایی (مکزیک)، پرتغالی (برزیل)، پرتغالی (پرتغال)، کره‌ای، چینی (ساده‌شده)، ترکی، روسی، تایلندی، هلندی، رومانیایی و مجارستانی.

در شرایطی که افراد به طور طبیعی زبان‌ها را با هم ترکیب می‌کنند، مایکروسافت از قابلیت کد-سوئیچینگ نیز پشتیبانی می‌کند که بازتاب‌دهنده نحوه واقعی صحبت‌کردن افراد است. در آزمایش‌های داخلی، مدل قادر است بدون ازدست‌دادن طبیعی‌بودن آهنگ گفتار (prosodic naturalness) یا هویت گوینده، به‌صورت روان در میانه جمله بین زبان‌ها جابه‌جا شود.

سنتز صوتی

توسعه‌دهندگان می‌توانند یک صدای سفارشی در Microsoft Foundry در تمام زبان‌های پشتیبانی‌شده ایجاد کنند؛ تنها با استفاده از یک کلیپ مرجع کوتاه بدون نیاز به بازآموزی (retraining) یا تنظیم دقیق (fine-tuning). با تنها چند ثانیه صوت (توصیه‌شده: ۵ تا ۶۰ ثانیه)، MAI Voice 2 می‌تواند گفتار با کیفیت بالا تولید کند که هویت گوینده را بازتولید می‌کند؛ این موضوع باعث می‌شود شرکت‌ها بتوانند به‌سادگی صدای برند خود را در محصولات وارد کنند، بدون آنکه نیاز به نگهداری یک مدل صوتی جداگانه داشته باشند.

رضایت در سطح سیستم اعمال می‌شود. تنها صداهای مجاز و دارای مجوز و لایسنس‌شده می‌توانند در محیط تولید سنتز شوند. هیچ‌گونه شبیه‌سازی و ویس کلونینگ صدای بدون مجوز امکان‌پذیر نیست.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]