در حاشیه رویداد Build 2026 رونمایی شد
MAI-Code-1-Flash؛ مدل کدنویسی عاملمحور مایکروسافت
MAI-Code-1-Flash مدل کدنویسی جدید از مایکروسافت است که برای ارائه کمک سریع و کارآمد در جریانهای کاری روزمره توسعهدهندگان ساخته شده است.
این مدل بهصورت سرتاسری توسط مایکروسافت و با استفاده از دادههای پاکسازیشده و دارای مجوز مناسب توسعه یافته است. این مدل در حال انتشار برای کاربران GitHub Copilot در محیط Visual Studio Code در بخش model picker و همچنین در حالت auto picker بهعنوان گزینه پیشفرض است.
ویژگیها و قابلیتها
- کدنویسی عاملمحور (agentic coding) در محیطهای کاری واقعی توسعهدهندگان، آموزشدیده و طراحیشده برای چارچوب GitHub Copilot، برای همکاری بهتر میان ابزارها.
- تفکر تطبیقی (adaptive thinking) در درخواستهای ساده، پاسخهای خلاصه ارائه میدهد و برای مسائل پیچیده، توکن استدلالی بیشتری مصرف میکند.
- توانمندی در پیروی از دستورالعملها (instruction-following) در سناریوهای تکمرحلهای و چندمرحلهای.
MAI-Code-1-Flash با هدف ساده کمک در کدنویسی با کیفیت بالا و بهرهوری بهتر طراحی شده است. این مدل در بنچمارکهای کدنویسی، نسبت به Claude Haiku 4.5 عملکرد بهتری با نسبت قیمت به کارایی بالاتر ارائه میدهد.

ساختهشده برای توسعهدهندگان، نه صرفاً بنچمارکها
مدلهای کدنویسی زمانی بیشترین ارزش را دارند که در همان محیطی که توسعهدهندگان هر روز استفاده میکنند، عملکرد خوبی داشته باشند. به همین دلیل مایکروسافت MAI-Code-1-Flash را با تمرکز بر گردش کارهای تولید (production workflows) ساخته است، نه صرفاً بهینهسازی برای بنچمارکها.
این مدل مستقیماً با استفاده از محدودکنندههای GitHub Copilot که در محیط تولید استفاده میشوند آموزش داده شده است. این امر به مدل اجازه میدهد یاد بگیرد چگونه با ابزارها و سیستمهای پیرامونی در وظایف کدنویسی عاملمحور تعامل کند و در نتیجه نسبت به سایر مدلهای موجود، برای جریانهای کاری واقعی Copilot مناسبتر است.
در طول آموزش، مایکروسافت نقاط کنترل را در وظایف اصلی مهندسی نرمافزار ارزیابی کرد؛ از جمله پاسخ به سؤالات درباره مخازن (repository question answering)، بازآرایی کد (refactoring) و وظایف مبتنی بر تلهمتری که از استفاده واقعی GitHub Copilot استخراج شده بودند. این همراستایی میان آموزش، ارزیابی و تولید باعث میشود بهبودهای آفلاین به کیفیت واقعی در محیط توسعهدهنده تبدیل شوند.
طراحیشده برای بیشینهسازی ارزش بهازای هر توکن
MAI-Code-1-Flash با کنترل تطبیقی طول پاسخ (adaptive solution length control) آموزش دیده است؛ قابلیتی که به مدل کمک میکند عمق پاسخ خود را باتوجهبه نوع مسئله تنظیم کند. این مدل میتواند برای درخواستهای ساده، پاسخهای کوتاه ارائه دهد و در مسائل پیچیده، بودجه استدلالی بیشتری مصرف کند. در عمل، این یعنی توسعهدهندگان سریعتر به خروجی قابلاستفاده میرسند. MAI-Code-1-Flash مسائل دشوار را با استفاده از تا ۶۰ درصد توکن کمتر حل میکند. این موضوع باعث کاهش تأخیر، کاهش هزینه، افزایش بازدهی بهازای هر توکن، و روانتر شدن تجربه تعامل میشود.
نتایج بنچمارک در محیط تولید
برای سنجش همزمان کیفیت و بهرهوری، MAI-Code-1-Flash در برابر Claude Haiku 4.5 روی مجموعههای SWE-Bench Verified ،SWE-Bench Pro ،SWE-Bench Multilingual و Terminal Bench 2 ارزیابی شده است؛ آن هم با استفاده از همان محیطهای تولیدی که توسعهدهندگان در کارهای روزمره خود استفاده میکنند و نرخ موفقیت وظایف و میانگین تعداد توکنهای لازم برای تکمیل هر وظیفه را اندازهگیری شده است.
MAI-Code-1-Flash در تمام بنچمارکهای اصلی کدنویسی از Claude Haiku 4.5 عملکرد بهتری دارد؛ با نرخ موفقیت بالاتر در هر ۴ ارزیابی. این فقط به معنای «هوشمندتر بودن» نیست؛ بلکه به معنای «کممصرفتر بودن» نیز هست. این مدل مسائل دشوار را با استفاده از تا ۶۰ درصد توکن کمتر در SWE-Bench Verified حل میکند و نشان میدهد که دقت بالاتر و بهرهوری بیشتر دیگر یک بدهبستان نیستند.

وظایف ریاضی، علمی، پیروی از دستورالعمل و کدنویسی عاملمحور
MAI-Code-1-Flash در همه این بنچمارکها جلوتر است؛ بیشترین اختلاف مربوط به IF Bench در دقت پیروی از دستورالعملها (۲۸.۹) و کمترین اختلاف مربوط به Advanced IF مبتنی بر روبریک (۱۴.۵) است. این توانایی قوی در پیروی از دستورالعملها به استفاده عاملمحور از ابزارها نیز منتقل میشود.

علاوه بر این، MAI-Code-1-Flash در قابلیتهای استدلالی اصلی در حوزه ریاضی، علوم و کدنویسی مبتنی بر دادههای بصری نیز از Claude Haiku 4.5 عملکرد بهتری دارد.

بنچمارکهای پیشرفته و ارزیابی استدلال
بنچمارکهای استاندارد معمولاً بهاندازه حافظه، به استدلال نیز پاداش میدهند. برای مثال، مدلی که مسئله Monty Hall را دیده باشد بهدرستی پاسخ میدهد، اما اگر جایگزینی احتمالات تغییر کند، ممکن است شکست بخورد. مایکروسافت یک بنچمارک ۱۸۶ سؤالی در ۳۴ دسته طراحی کرده که شامل تلههای خصمانه مانند نسخههای معکوسشده مسائل کلاسیک، وظایف غیرممکن و سناریوهای نامعین است؛ با هدف بررسی اینکه آیا مدل واقعاً در حال استدلال است یا صرفاً الگوها را تطبیق میدهد.
MAI-Code-1-Flash در مجموع از Claude Haiku 4.5 پیشی میگیرد و به دقت تعدیلشده ۸۵.۸ درصد رسیده است؛ با عملکرد قوی در استدلال، پیروی از دستورالعملها و تشخیص مسائل غیرممکن. همچنین همچنان فضای بهبود وجود دارد، زیرا برخی دستههای استدلالی خصمانه مانند Einstellung traps هنوز زیر ۵۰ درصد دقت قرار دارند.
امتحان کنید
MAI-Code-1-Flash اکنون در حال انتشار برای کاربران فردی Visual Studio Code در GitHub Copilot است. نیازی به تنظیمات اضافی نیست. با پیشرفت انتشار، ممکن است مشاهده کنید که GitHub Copilot وظایف را از طریق حالت Auto به MAI-Code-1-Flash ارجاع میدهد، یا این مدل بهصورت مستقیم در model picker در دسترس قرار میگیرد.