آنقدر خوب که با DeepSeek V4 اشتباه گرفته شد
مدل هوش مصنوعی MiMo v2 Pro از شیائومی
شیائومی غالباً بهعنوان برند موبایلهای هوشمند اقتصادی شناخته میشود. اما این یک برداشت اشتباه و بزرگ است. شیائومی سومین تولیدکننده بزرگ گوشیهای هوشمند جهان است و پس از اپل و سامسونگ، در سال ۲۰۲۵ تقریباً ۱۷۰ میلیون گوشی به بازار عرضه کرده است. این شرکت تلویزیون، دستگاه تصفیه هوا، مچبند تناسباندام، اسکوتر برقی، پوشاک و اکنون خودرو و مدل هوش مصنوعی میسازد.
خودرو SU7 Ultra شیائومی سال گذشته رکورد سریعترین خودروی الکتریکی تولید انبوه را در پیست Nürburgring شکست و از ریماک و پورشه پیشی گرفت. این شرکت اخیراً با بلاکچین Sei همکاری کرده است تا کیف پولهای رمزنگاریشده کریپتو را بهصورت پیشفرض روی دستگاههای خود در سراسر اروپا، آمریکای لاتین و آسیای جنوب شرقی نصب کند. ارزش بازار این شرکت حدود ۱۳۷ میلیارد دلار است؛ بنابراین، وقتی شیائومی یک مدل هوش مصنوعی منتشر میکند، شاید بهتر باشد به آن توجه کنیم.
کمین بیسروصدا
به نقل از decrypt در تاریخ ۱۸ مارس ۲۰۲۶، بازوی تحقیقاتی اختصاصی هوش مصنوعی این شرکت بیسروصدا سه مدل را به طور همزمان منتشر کرد؛ مدلهای MiMo-V2-Pro، MiMo-V2-Omni و یک مدل تبدیل متن به گفتار. اولین مدل از نسل جدید MiMo به نام MiMo-V2-Flash با ۳۰۹ میلیارد پارامتر و معماری mixture-of-experts در دسامبر ۲۰۲۵ عرضه شد و تقریباً هیچکس خارج از جامعه هوش مصنوعی چین به آن توجهی نکرد و مطبوعات فناوری غرب عمدتاً نسبت به آن بیتفاوت بودند.
سپس در ۱۱ مارس، یک مدل ناشناس یک تریلیون پارامتری به نام Hunter Alpha بدون ذکر نام توسعهدهنده در OpenRouter منتشر شد و به صدر جدول امتیازات OpenRouter صعود کرد، از مجموع یک تریلیون توکن مصرفی فراتر رفت و بلافاصله گمانهزنیهای گستردهای را برانگیخت که این همان نسخه منتشرنشده V4 از شرکت DeepSeek است.
نهتنها در چین بلکه در سطح جهانی نیز شمار زیادی منتظر انتشار DeepSeek V4 بودند و هنوز هم هستند و افراد مطلع ادعا میکردند که در وظایف کدنویسی از Claude و ChatGPT عملکرد بهتری خواهد داشت. اما آن مدل منتشرشده در OpenRouter، مدل جدید DeepSeek نبود.
در ۱۸ مارس، «لو فولی» (Luo Fuli)، رئیس بخش MiMo در شیائومی و محقق سابق DeepSeek فاش کرد که Hunter Alpha یک نسخه آزمایشی داخلی اولیه از MiMo-V2-Pro بوده است. پس از این عرضه سهام شیائومی ۵.۸ درصد جهش کرد و لو در شبکه اجتماعی X نوشت: «من این را یک کمین بیسروصدا مینامم.»
ساختار
مدل MiMo دارای بیش از یک تریلیون پارامتر است که ۴۲ میلیارد آن در هر درخواست، از طریق یک ساختار MoE فعال میشود. یک سازوکار توجه ترکیبی (Hybrid Attention Mechanism) که با نسبت ۷:۱ کار میکند، پنجره زمینه تا یک میلیون توکن را مدیریت میکند. یک لایه پیشبینی چندتوکنی داخلی (Multi-token Prediction Layer)، سرعت تولید را با پیشبینی چندین توکن در هر مرحله بهجای یک توکن در هر زمان افزایش میدهد. این مدل در حال حاضر منبعبسته است، اگرچه شیائومی احتمال انتشار منبعباز آن در آینده را رد نکرده است.
مدل MiMo-V2-Omni نیز بینایی، صوت و ویدیو را بهصورت بومی پردازش میکند؛ نه بهعنوان ماژولهای الحاقی، بلکه بهعنوان یک سیستم ادراکی یکپارچه که بهصورت سرتاسری آموزش دیده است.
بنچمارکها
طبق آخرین آمار در زمان نگارش این گزارش، مدل MiMo-V2-Pro در شاخص هوش مصنوعی Artificial Analysis در رتبه هشتم جهان و رتبه دوم در میان مدلهای چینی قرار دارد (مدل GLM-5 رتبه اول مدلهای چینی را در اختیار دارد). در بنچمارک SWE-bench Verified که مختص وظایف مهندسی نرمافزار در دنیای واقعی است، این مدل امتیاز ۷۸ درصد را در برابر امتیاز ۸۰.۸ درصد مدل Claude Opus 4.6 و ۷۹.۶ درصد مدل Claude Sonnet 4.6 کسب کرده است. در ClawEval، که بنچمارک عاملمحور مرتبط با چارچوب OpenClaw است، این مدل به امتیاز ۶۱.۵ میرسد که به امتیاز ۶۶.۳ مدل Opus 4.6 نزدیک است. در بنچمارک PinchBench نیز با امتیاز ۸۱.۰ در رتبه سوم جهان قرار دارد، درست پشت سر Opus 4.6 با امتیاز ۸۱.۵ و مدل همخانوادهاش یعنی MiMo-V2-Omni با امتیاز ۸۱.۲.
برنامهنویسی و ریاضیات
هزینه MiMo-V2-Pro یک دلار به ازای هر میلیون توکن ورودی و ۳ دلار به ازای هر میلیون توکن خروجی، تا سقف پنجره زمینه ۲۵۶ هزار توکن است. اجرای Claude Sonnet 4.6 حدود ۳ دلار به ازای هر میلیون ورودی و ۱۵ دلار به ازای هر میلیون خروجی هزینه دارد و هزینه Opus 4.6 برابر با ۵ دلار ورودی و ۲۵ دلار خروجی است. برای توسعهدهندگانی که سیستمهای عاملمحور را در مقیاس وسیع میسازند، این اعداد صرفاً یک هزینهکرد متداول فناوری نیستند.
اعداد و ارقام بنچمارکها نشان میدهند که کدنویسی قویترین نقطه قوت MiMo-V2-Pro است و تجربههای عملی نیز این کدهای نوشتهشده با این مدل را کارآمد میدانند. منظور از «کارآمد» صرفاً اجرای فنی برنامهنویسی نیست، بلکه به این معناست که منطق برنامهنویسی بهخوبی رعایت شود بود. بهعنوان مثال در کدنویسی و طراحی بازی، ترکیب صحت و زیباییشناسی دقیقاً همان جایی است که اکثر مدلها در آن شکست میخورند و معمولاً یکی از این دو را به دست میآورند.
ریاضیات جایی است که MiMo-V2-Pro سقف تواناییهای خود را نشان میدهد. به طور کلی، این مدل برای مسائل ریاضی معمولی و حتی دشوارتر مشکلی ندارد، اما ریاضیات پیشرو (Frontier Math) نقطه قوت آن نیست؛ حداقل هنوز نه. استفاده از ویژگی عاملمحور بهجای استفاده صرف از LLM ممکن است نتایج بهتری به همراه داشته باشد.
ویژگیهای عاملمحور
شیائومی همان استراتژی MiniMax و Kimi را دنبال میکند و یکپارچهسازی با یک کلیک OpenClaw را ارائه میدهد که یک نمونه ابری از پیشتنظیمشده با MiMo-V2-Pro بهعنوان مدل زیربنایی را راهاندازی میکند. هیچ نیازی به راهاندازی API، عدم نیاز به VPS، عدم پیکربندی مهارت و هیچ جلسه عیبیابی یکساعتهای قبل از اجرای اولین وظیفه شما وجود ندارد. کلیک میکنید و کار میکند. محیط دمو به مدت ۳۰ دقیقه اجرا میشود و سپس خود را از بین میبرد که این یک محدودیت واقعی، اما درعینحال صادقانه است. برای توسعهدهندگانی که از قبل با زیرساختهای عاملمحور راحت هستند، این ویژگی چیزی اضافه نمیکند. برای دیگران، این روانترین و بدوناصطکاکترین مسیر ورود به هوش مصنوعی عاملمحور است که میتوانند تجربه کنند.
جمعبندی
با درنظرگرفتن همه جوانب، MiMo-V2-Pro یک مدل جدی است. این مدل کامل نیست؛ سقف توانایی آن در ریاضیات واقعی است، گاهی اوقات و در برخی چالشهای حقوقی شفافیت زنجیره تفکر، نقص استدلالی آشکاری دارد و مصرف توکن در طول وظایف استدلالی دشوار بهسرعت بالا میرود.
اگر هزینهها برای شما مهم است، قیمتگذاری شیائومی تهاجمی و بسیار رقابتی است؛ کسری از هزینه Claude Opus یا جدیدترین مدلهای OpenAI و گوگل و توانمندتر از GLM یا MiniMax در حوزههایی که برای کارهای خلاقانه و عاملمحور بیشترین اهمیت را دارند. این مدل پرهزینه فکر میکند و این ممکن است یک نقطهضعف باشد. اگر جریانهای کاری عاملمحور با حجم بالا را اجرا میکنید، مراقب سوختن توکنها باشید، حتی اگر در نهایت هزینه کمتری نسبت به استفاده از Claude بپردازید. اگر کارهای غنی و با پایان باز انجام میدهید که در آن کیفیت خروجی، معیار اصلی است، در این صورت MiMo-V2-Pro جایگاه خود را در لیست نهایی بهترینها به دست میآورد.