مایکروسافت ۳ مدل هوش مصنوعی جدید را در رقابت مستقیم با OpenAI و گوگل عرضه کرد
مایکروسافت اخیراً ۳ مدل پایهای جدید هوش مصنوعی که کاملاً درونسازمانی توسعه داده است را رونمایی کرد. این مدلهای جدید شامل یک سیستم پیشرفته گفتار به متن به نام MAI-Transcribe-1، یک موتور مولد صوت به نام MAI-Voice-1 و یک مدل مولد تصویر ارتقایافته به نام MAI-Image-2 و از طریق Microsoft Foundry و محیط جدید MAI Playground در دسترس هستند. این اقدام تاکنون واضحترین نمونهای است که نشان میدهد این غول فناوری ۳ تریلیون دلاری قصد دارد مستقیماً با OpenAI، گوگل و سایر آزمایشگاههای پیشرو در توسعه مدل و نهفقط در توزیع آن رقابت کند.
لحظهای حساس برای مایکروسافت
این مدلها ۳ مورد از ارزشمندترین مُدالیتههای تجاری در هوش مصنوعی سازمانی یعنی تبدیل گفتار به متن، تولید صدای واقعگرایانه انسانی و خلق تصاویر را پوشش میدهند. این مدلها در کنار یکدیگر، نمایانگر نخستین گام از سوی تیم ابرهوش مایکروسافت هستند که «مصطفی سلیمان» تنها شش ماه پیش برای پیگیری آنچه او «خودکفایی در هوش مصنوعی» مینامد، تشکیل داد.
سلیمان پیش از اعلام عمومی، در مصاحبهای با VentureBeat گفت: «من بسیار هیجانزدهام که اولین مدلها را عرضه کردهایم. نهتنها این، بلکه ما قادریم این مدل را با نیمی از پردازندههای گرافیکی (GPU) رقبای پیشتاز در لبه فناوری ارائه کنیم.»
این اعلامیه در لحظهای حساس برای مایکروسافت منتشر میشود. سهام این شرکت بهتازگی بدترین سهماهه خود را از زمان بحران مالی ۲۰۰۸ به پایان رسانده؛ زیرا سرمایهگذاران خواستار اثبات این موضوع هستند که صدها میلیارد دلار هزینه در زیرساختهای هوش مصنوعی به درآمد ملموس تبدیل خواهد شد. این مدلها که قیمتگذاری تهاجمی دارند و با هدف کاهش بهای تمامشده کالای فروشرفته (COGS) خود مایکروسافت جایگاهیابی شدهاند، نخستین پاسخ سلیمان به این فشارها محسوب میشوند.
تبدیل گفتار به متن
مدل MAI-Transcribe-1، عنصر اصلی این مجموعه است. این مدلِ تبدیل گفتار به متن، به کمترین میانگین «نرخ خطای کلمه» (WER) در بنچمارک FLEURS (آزمون چندزبانه استاندارد) در ۲۵ زبان برتر بر اساس استفاده از محصولات مایکروسافت دست یافته است و میانگین WER آن ۳.۸ درصد است. بر اساس بنچمارکهای مایکروسافت، این مدل در تمامی ۲۵ زبان از Whisper-large-v3 متعلق به OpenAI، در ۲۲ زبان از ۲۵ زبان از Gemini 3.1 Flash گوگل و در ۱۵ زبان از ۲۵ زبان از Scribe v2 شرکت ElevenLabs و GPT-Transcribe متعلق به OpenAI پیشی گرفته است.
این مدل از یک دیکودر متنی مبتنی بر ترانسفورمر به همراه یک انکودر صوتی دوسویه استفاده میکند. این مدل فایلهای MP3، WAV و FLAC تا حجم ۲۰۰ مگابایت را میپذیرد و مایکروسافت اعلام کرده است که سرعت رونویسی گروهی آن ۲٫۵ برابر سریعتر از سرویس فعلی Microsoft Azure Fast است. قابلیتهایی نظیر تفکیک گوینده، سوگیری زمینهای (Contextual Biasing) و پردازش جریانی در فهرست ویژگیهای «بهزودی دردسترس» این مدل قرار دارند. مایکروسافت در حال حاضر MAI-Transcribe-1 را در حالت صوتی Copilot و Microsoft Teams برای رونویسی مکالمات آزمایش میکند.
تبدیل متن به گفتار
MAI-Voice-1 مدل تبدیل متن به گفتار مایکروسافت است که توانایی تولید ۶۰ ثانیه صوت طبیعی تنها در یک ثانیه را دارد. این مدل هویت گوینده را در محتواهای طولانی حفظ میکند و اکنون از طریق Microsoft Foundry، خلق صدای سفارشی را تنها با استفاده از چند ثانیه صوت امکانپذیر میکند. مایکروسافت قیمت آن را ۲۲ دلار بهازای هر ۱ میلیون کاراکتر تعیین کرده است.
تولید تصویر
مدلMAI-Image-2 بهعنوان یکی از سه خانواده برتر مدلهای مولد تصویر در جدول امتیازات Arena.ai معرفی شد و اکنون در Foundry و Copilot زمان تولید حداقل ۲ برابر سریعتر از نسخه پیشین خود را ارائه میدهد. مایکروسافت در حال استقرار آن در Bing و PowerPoint است و قیمت آن را ۵ دلار بهازای هر ۱ میلیون توکن برای ورودی متن و ۳۳ دلار بهازای هر ۱ میلیون توکن برای خروجی تصویر تعیین کرده است. شرکت WPP، یکی از بزرگترین هلدینگهای تبلیغاتی جهان، در میان اولین شرکای سازمانی است که با استفاده از MAI-Image-2 در مقیاس وسیع در حال توسعه محصولات است.
برای درک اهمیت این مدلها، باید تغییرات ساختاری و قراردادی بنیادینی که آنها را امکانپذیر کرده است، درک کنید؛ زیرا تا اکتبر ۲۰۲۵، مایکروسافت بهموجب قراردادی از اقدامات مستقل جهت دستیابی به هوش جامع مصنوعی (AGI) منع شده بود.
