Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
جیتکس ترکیه
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 DeepSeek-V4.1-Flash؛ معماری جدید برای هوش مصنوعی سریع‌تر و کم‌هزینه‌تر

DeepSeek-V4.1-Flash

DeepSeek-V4.1-Flash؛ معماری جدید برای هوش مصنوعی سریع‌تر و کم‌هزینه‌تر

زمان مطالعه: 3 دقیقه

استارتاپ چینی DeepSeek مدل DeepSeek-V4.1-Flash را به‌عنوان کوچک‌ترین مدل در خانواده معماری جدید خود معرفی کرد؛ مدلی چندوجهی که از درک بومی تصویر برخوردار است و با هدف افزایش توانایی، سرعت استنتاج و امکان مقیاس‌پذیری توسعه یافته است.

این مدل یک معماری «ترکیب خبرگان» (MoE) با ۵۵۲ میلیارد پارامتر دارد و از پنجره زمینه‌ای تا یک میلیون توکن پشتیبانی می‌کند. مدل می‌تواند متن و تصویر را به‌صورت بومی پردازش و متن را به شکل خودبازگشتی تولید کند.

مهم‌ترین تغییر معماری در V4.1-Flash استفاده از ساختار Causal Encoder–Decoder (CED) است. این ساختار شامل یک ترنسفورمر ۴۰ لایه‌ای است که از یک رمزگذار علّی ۲۰ لایه‌ای و یک رمزگشا ۲۰ لایه‌ای تشکیل شده است. در این معماری، کش کلید-مقدار یا KV Cache مربوط به رمزگشا از حالت‌های نهایی رمزگذار تولید می‌شود، نه از حالت‌های هر لایه رمزگشا. در نتیجه، هنگام پیش‌پردازش ورودی تنها ۸ میلیارد پارامتر و هنگام تولید خروجی ۱۶ میلیارد پارامتر فعال می‌شوند. DeepSeek این طراحی را راهی برای افزایش بهره‌وری هزینه، به‌ویژه در بارهای کاری عامل‌محور و ورودی‌محور، معرفی می‌کند.

یکی از محورهای اصلی V4.1-Flash کاهش اندازه KV Cache است. این مدل از روش SWA Bounded Replay برای بازسازی حالت‌های گمشده SWA KV استفاده می‌کند؛ روشی که تنها آخرین بخش توکن‌ها را بازپخش می‌کند و نیاز به ذخیره KV روی SSD را از بین می‌برد. در نتیجه، حجم KV Cache پایدار به حدود یک‌هشتم مدل DeepSeek-V4-Flash کاهش یافته است.

مدل V4.1-Flash همچنین از Compressed Sparse Attention 2 (CSA2) استفاده می‌کند. در این روش، هر لایه توجه یکی از سه حالت ثابت Full، Reindex یا Reuse را به خود اختصاص می‌دهد. این طراحی امکان اشتراک‌گذاری KV اصلی و K مربوط به indexer میان لایه‌ها و استفاده مجدد از شاخص‌های Top-K مربوط به توجه تنک یا اسپارس را فراهم می‌کند. در بخش رمزگشا نیز یک Hierarchical Sparse Indexer دامنه جست‌وجوی لایه‌های بعدی را به مجموعه‌ای از گزینه‌ها محدود می‌کند که نخستین لایه Full Mode ساخته است. DeepSeek همچنین از FP4 main KV caching استفاده کرده است. ترکیب این روش‌ها اندازه KV Cache سراسری را به ۸۹۰ بایت برای هر توکن می‌رساند؛ یعنی تقریباً یک‌چهارم DeepSeek-V4-Flash. در بخش چندوجهی نیز یک رمزگذار بینایی با نام DeepSeek-ViT که از ابتدا آموزش داده شده، تصاویر را پردازش می‌کند. این ادغام‌ها از ابتدای مرحله پیش‌آموزش در کنار embeddingهای متنی پردازش می‌شوند.

گزارش فنی DeepSeek-V4.1-Flash

DeepSeek-V4.1-Flash از ابتدا روی یک پیکره چندوجهی شامل ۴۵ تریلیون توکن آموزش داده شده است. آموزش توجه تنک در طول توالی ۶۴ هزار توکن انجام شده و سپس زمینه مدل تا یک میلیون توکن گسترش یافته است. در مرحله پساآموزش، مدل از روند استاندارد SFT → RL → on-policy distillation (OPD) استفاده می‌کند. تغییرات اصلی، به گفته DeepSeek، در خط لوله داده‌ها اعمال شده‌اند؛ از جمله تولید خودکار در مقیاس بزرگ برای وظایف و محیط‌های عامل‌محور و افزایش تدریجی مقیاس داده‌ها، وظایف و rolloutها. مدل همچنین امکان کنترل پیوسته میزان تلاش برای استدلال را از ۱ تا ۱۰۰ فراهم می‌کند تا میان هزینه استنتاج و دقت تعادل ایجاد شود.

نتایج بنچمارک‌های ارائه‌شده نشان می‌دهد V4.1-Flash در برخی آزمون‌ها از مدل‌های بزرگ‌تر عملکرد بهتری دارد. برای نمونه، در HumanEval امتیاز ۷۹.۴، در GSM8K امتیاز ۹۳.۰ و در BigCodeBench امتیاز ۶۰.۶ ثبت کرده است. در آزمون‌های عامل‌محور نیز V4.1-Flash در Terminal-Bench 2.1 امتیاز ۹۰.۶، در Terminal-Bench 3.0 امتیاز ۳۰.۰ و در DeepSWE v1.1 امتیاز ۷۴.۲ به دست آورده است. در ارزیابی‌های چندوجهی نیز مدل در MMMU-Pro امتیاز ۵۶.۵، در CVBench امتیاز ۷۷.۹ و در DocVQA امتیاز ۹۵.۶ کسب کرده است.

در مقایسه با مدل‌های مرزی، V4.1-Flash در برخی آزمون‌های عامل‌محور از مدل‌های مورد مقایسه، از جمله DeepSeek-V4-Pro، عملکرد بالاتری دارد. برای مثال، امتیاز آن در Terminal-Bench 2.1 برابر ۹۰.۶ و در DeepSWE v1.1 برابر ۷۴.۲ گزارش شده است.

در سطح سرویس، V4.1-Flash از ۱۰ سپتامبر ۲۰۲۶ روی API دیپ‌سیک در دسترس قرار گرفته و از قابلیت چندوجهی بومی پشتیبانی می‌کند. شناسه مدل در API برابر deepseek-flash است. مدل‌های V4-Flash و V4-Flash-Vision-Exp بازنشسته شده‌اند و شناسه‌های قبلی آن‌ها به طور موقت به V4.1-Flash هدایت می‌شوند.

در بخش هزینه، DeepSeek تأکید می‌کند که معماری جدید امکان ارائه سرویس با هزینه پایین‌تر را فراهم کرده است. KV Cache در مقایسه با نسل قبلی به یک‌چهارم HBM و یک‌هشتم فضای SSD نیاز دارد. ازآنجاکه هزینه‌های مربوط به cache-hit می‌تواند بخش بزرگی از هزینه عامل‌ها را تشکیل دهد، DeepSeek کاهش حجم cache را عاملی برای کاهش هزینه معرفی می‌کند. همچنین نرخ‌های خارج از ساعات اوج مصرف، ۵۰ درصد نرخ‌های اوج هستند.

DeepSeek همچنین اعلام کرده است که از جامعه متن‌باز برای توسعه پشتیبانی استنتاج V4.1-Flash و گسترش گزینه‌های استقرار این مدل حمایت خواهد کرد. مدل تحت مجوز MIT منتشر شده و امکان اجرای آن با ابزارهایی مانند Transformers، vLLM، SGLang و Docker در صفحه Hugging Face ارائه شده است. صفحه مدل همچنین روش‌هایی برای استفاده محلی و پشتیبانی از ابزارهایی مانند llama.cpp، Ollama و LM Studio از طریق مدل‌های quantized ارائه می‌کند.

در مجموع، DeepSeek-V4.1-Flash بر سه محور اصلی بنا شده است: معماری Causal Encoder–Decoder با تعداد پارامترهای فعال کمتر، کاهش چشمگیر KV Cache و تمرکز بر بارهای کاری عامل‌محور و چندوجهی. DeepSeek این ترکیب را برای دستیابی هم‌زمان به توانایی بیشتر، استنتاج سریع‌تر، گذردهی بالاتر و هزینه پایین‌تر ارائه کرده است.

دسترسی و دانلود DeepSeek-V4.1-Flash از HuggingFace

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]