تلاش استدلالی مایکروسافت
مدل MAI-Thinking-1؛ اولین مدل استدلالی مایکروسافت
مایکروسافت در جریان رویداد Build 2026 از جدیدترین مدل استدلالی MAI به نام MAI-Thinking-1 رونمایی کرد. این مدل در رده مدلهای میانمقیاس قرار میگیرد و در میان مدلهای همرده خود از قدرتمندترینها محسوب میشود.
مدل MAI-Thinking-1 در بنچمارکهای کلیدی مهندسی نرمافزار عملکردی همسطح با مدلهای پیشرو دارد، توانمندیهای پیشرفتهای در استدلال ریاضی از خود نشان میدهد و در ارزیابیهای کورِ مقایسهای انسانی مایکروسافت، به Sonnet 4.6 ترجیح داده شده است. این مدل از ابتدا و به طور کامل با استفاده از دادههای تمیز، دارای مجوز تجاری و در سطح سازمانی آموزشدادهشده و در فرایند توسعه آن هیچگونه تقطیر دانش (Distillation) از مدلهای شخص ثالث انجام نشده است.
ماشین صعود به قله (Hill-Climbing Machine)
MAI-Thinking-1 گامی در مسیر تلاش گستردهتر مایکروسافت برای ساخت ابرهوش انسانمحور (Humanist Superintelligence) است؛ یعنی قابلیتهای پیشرفته هوش مصنوعی که برای خدمت به انسانها و سازمانها طراحی شدهاند، نه برای جایگزینی آنها. اهمیت این مدل را میتوان از دو منظر ارزیابی کرد: آنچه قادر به انجام آن است و شیوهای که با آن ساخته شده است.
فراتر از معرفی یک مدل منفرد، مایکروسافت از مفهوم «ماشین صعود به قله» خود رونمایی کرد؛ یک خط لوله توسعه که بهصورت مشترک طراحی شده تا تمامی اجزای فرایند ساخت مدل قابلیت «صعودپذیری» داشته باشند و در نتیجه، توانمندیها بهصورت مستمر و قابلاعتماد در طول زمان بهبود یابند. هدف مایکروسافت ایجاد سیستمی تکرارپذیر است که بتواند دادههای بهتر، پاداشهای قویتر، محیطهای توانمندتر و منابع محاسباتی بیشتر را جذب و در خود ادغام کند.
مایکروسافت سه اصل بنیادین را راهنمای فلسفه خود در این مسیر میداند:
- توانمندیها باید آموخته شوند، نه اینکه به ارث برسند هرچند بهدستآوردن هوشِ بهارثرسیده سریعتر است، اما چنین هوشی فاقد قابلیت هدایتپذیری لازم برای استفاده در دنیای واقعی است. یک مدل تقلیدکننده به طور ذاتی به انتخابهای طراحی معلم خود وابسته است و در تطبیق با شرایط جدید با دشواری مواجه میشود. MAI-Thinking-1 بدون استفاده از تقطیر دانش از مدلهای شخص ثالث آموزشدادهشده است؛ رویکردی که مدل را وادار میکند وظایف موردنظر را واقعاً بیاموزد.
- دادههای تمیز MAI-Thinking-1 بر پایه دادههای تمیز و دارای مجوز مناسب آموزش دیده است و در مرحله پیشآموزش، محتوای تولیدشده توسط هوش مصنوعی از مجموعهدادهها حذف شده است. این موضوع از منظر کیفیت، منشأ دادهها و قابلیت کنترل اهمیت دارد. اگر ندانیم چه عواملی در شکلگیری یک مدل نقش داشتهاند، نمیتوانیم رفتار آن را به طور کامل درک کنیم یا بهصورت معتبر آن را بهبود دهیم.
- خودکفایی در سراسر پشته فناوری از طراحی مشترک مدلها با شتابدهندههای اختصاصی مایکروسافت گرفته تا چارچوب یادگیری تقویتی، تمرکز اصلی مایکروسافت بر توسعه زیرساختهای آموزشی درونسازمانی بوده است. این موضوع بخشی حیاتی از ساخت ماشین صعود به قله محسوب میشود؛ زیرا تضمین میکند که بتواند کل سامانه را از ابتدا تا انتها به طور کامل بهینهسازی و هدایت کند تا بیشترین همراستایی را با نیازهای خود داشته باشد.
مدلی میانمقیاس با عملکرد قدرتمند در مهندسی نرمافزار
MAI-Thinking-1 یک مدل ترکیب خبرگان تٌنک (Sparse Mixture of Experts) با ۳۵ میلیارد پارامتر فعال و در مجموع حدود یک تریلیون پارامتر است. در نتیجه، هزینه استنتاج آن بهمراتب کمتر از مدلهای بسیار بزرگتر است. با وجود این اندازه نسبتاً کوچکتر، این مدل در بنچمارک SWE-Bench Pro عملکردی همسطح با Claude Opus 4.6 دارد. این موضوع برای توسعهدهندگان و سازمانها اهمیت فراوانی دارد، زیرا اندازه مدل تعیین میکند که دستیارهای پیشرفته برنامهنویسی در چه محیطهایی قابلاستقرار هستند، با چه بسامدی میتوان از آنها استفاده کرد و آیا میتوانند از انجام وظایف استثنایی فراتر رفته و به بخشی از جریان کاری روزمره تبدیل شوند یا خیر.
مایکروسافت سرمایهگذاری گستردهای روی محیطهای آموزشی موردنیاز برای برنامهنویسی عاملمحور (Agentic Coding) انجام دادهاست. هر محیط تأییدشده، قطعی (Deterministic)، قابلاجرا و مبتنی بر ارزیابی توسط مجموعه آزمونهای واقعی است. این امر به مدل فرصت میدهد روی همان نوع کارهای چندمرحلهای تمرین کند که توسعهدهندگان در عمل انجام میدهند؛ از جمله مطالعه کد، ویرایش فایلها، اجرای آزمونها، مشاهده خطاها و بازیابی از اشتباهات میانمرحلهای.
توانمندیهای پیشرفته در استدلال ریاضی
MAI-Thinking-1 در آزمون AIME 2025 به امتیاز ۹۷٫۰ درصد و در AIME 2026 به امتیاز ۹۴٫۵ درصد دست یافته است؛ نتایجی که نشاندهنده توانایی بالای مدل در استدلال ریاضی و علمی نسبت بهاندازه آن هستند. عملکرد قدرتمند در این حوزه به مایکروسافت اطمینان میدهد که چرخه آموزشیاش قادر است پیشرفتهای واقعی در استدلال ایجاد کند؛ پیشرفتهایی که از پایه و باتکیهبر دادهها، سازوکارهای پاداشدهی و فرایندهای ارزیابی خودش حاصل شدهاند. این مسئله امکان تعمیم این هوشمندی به حوزههای دیگر را در طول زمان فراهم میکند.

ترجیح کاربران در مقایسههای انسانی با Sonnet 4.6
کاربران برای این موضوع اهمیت قائل هستند که آیا یک مدل وظیفه را بهدرستی درک میکند، دستورالعملها را رعایت میکند، از سطح مناسبی از جزئیات استفاده میکند، متنی شفاف مینویسد و به زمان آنها احترام میگذارد یا خیر.
مایکروسافت با همکاری Surge یک ارزیابی انسانی کور و مقایسهای طراحی کرد و از مجموعه ارزیابان حرفهای این شرکت برای سنجش عملکرد مدلهای مختلف در این ویژگیها بهره برد. این ارزیابی شامل ۱۲۷۶ وظیفه در طیف گستردهای از کاربردها، هم در مکالمات تکمرحلهای و هم چندمرحلهای بود و تمرکز اصلی آن بر سنجش میزان مفیدبودن پاسخها و میزان پیشبرد اهداف کاربران قرار داشت. در این ارزیابیها، کاربران MAI-Thinking-1 را به Claude Sonnet 4.6 ترجیح دادند.
این موضوع یکی از محورهای اصلی فرایند پساآموزش (Post-Training) بوده است. هدف مایکروسافت ساخت مدلی است که در عین توانمندی، شکننده نباشد؛ در عین اختصار، ناقص نباشد و در عین مفیدبودن، از حدود خود فراتر نرود. دادههای ترجیحات انسانی، سیگنالی مستقیم در اختیار قرار میدهند تا مشخص شود آیا بهبودهای حاصلشده در بنچمارکها واقعاً به تجربه بهتر کاربران منجر میشوند یا خیر.
آماده برای استفاده سازمانی
MAI-Thinking-1 از ابتدا با درنظرگرفتن نیازهای سازمانی طراحی شده است. این مدل از پنجره متنی ۲۵۶ هزار توکنی پشتیبانی میکند که برای جایدادن یک سند ۶۰۰ صفحهای کافی است. همچنین از فراخوانی تابع (Function Calling) و امکان افزودن دستورالعملهای توسعهدهندگان پشتیبانی میکند.
مایکروسافت این مدل را بهگونهای آموزش داده که بتواند چندین لایه از دستورالعملها را دنبال کند و سبک پیشفرض آن نیز با نیازهای سازمانی همراستا شده است. این مدل با API رایج Chat Completions سازگار است. تمامی مدلهای MAI نیز از طریق Microsoft Foundry به قابلیتهای امنیتی و انطباقپذیری در سطح سازمانی مجهز هستند.
نتایج
مایکروسافت نتایج را در دو قالب ارائه کرده است:
- ارزیابیهای MAI-Thinking-1 پس از مرحله آموزش نهایی (Post-Training)
- شاخصهای پیشآموزش (Pre-Training) مدل پایه

نتایج ارزیابی مدل پس از آموزش نهایی در بنچمارکهای عمومی STEM و برنامهنویسی عاملمحور. اعداد مربوط به سایر مدلها از کارتهای رسمی مدلهای مربوطه استخراج شدهاند. تمامی امتیازها بهصورت درصد هستند مگر در مواردی که خلاف آن ذکر شده باشد. خط تیره نشاندهنده عدم دسترسی به مقادیر مربوطه است.

قراردادن انسان در اولویت
مایکروسافت در مسیر ساخت ابرهوش انسانمحور حرکت میکند؛ قابلیتهای پیشرفته هوش مصنوعی که برای خدمت به انسانها و سازمانها طراحی شدهاند، نه برای جایگزینی آنها.
مدلهای باید فناوریهایی تابع انسان باقی بمانند؛ فناوریهایی که تحت کنترل انسان قرار دارند و هدف آنها حفظ خودمختاری انسان و ارائه کمک مؤثر است. این بدان معناست که مدلها نباید به بهانه ایمنی و انطباقپذیری، درخواستهای مشروع را رد کنند؛ زیرا در چنین شرایطی دیگر واقعاً در خدمت انسانها نخواهند بود.
برقراری تعادل میان مفیدبودن و ایمن بودن کار سادهای نیست. مایکروسافت در توسعه MAI-Thinking-1 تلاش کرد این تعادل را از طریق درنظرگرفتن «همراهی ناایمن» و «امتناع غیرضروری» بهعنوان دو نوع نقص در یک سازوکار پاداشدهی واحد برقرار کند؛ سازوکاری که در آن تجمیع امتیازها بر اساس شدت آسیب احتمالی صورت میگیرد.
ایمنی با استفاده از همان زیرساخت یادگیری تقویتی آموزش داده میشود که برای توسعه قابلیتهای مدل به کار میرود. بنابراین، پاداشهای مرتبط با ایمنی نیز بخشی از همان چرخه صعود مستمر هستند و اطمینان حاصل میکنند که ایمنی همواره با توانمندیهای مدل همسو باقی بماند و به ویژگیای اتفاقی تبدیل نشود.

در نتیجه، این مدل میتواند ضمن حفظ سطح موردنیاز ایمنی در برابر درخواستهای حساس و بالقوه خطرناک، در مواجهه با محتوای غیرحساس نیز مفید و کارآمد باقی بماند.
دسترسی و عرضه
MAI-Thinking-1 از امروز در قالب Private Preview در Microsoft Foundry در دسترس قرار گرفته است. همچنین این مدل بهزودی در قالب Public Preview از طریق MAI Playground نیز در دسترس کاربران قرار خواهد گرفت.