DeepSeek-V4.1-Flash
DeepSeek-V4.1-Flash؛ معماری جدید برای هوش مصنوعی سریعتر و کمهزینهتر
استارتاپ چینی DeepSeek مدل DeepSeek-V4.1-Flash را بهعنوان کوچکترین مدل در خانواده معماری جدید خود معرفی کرد؛ مدلی چندوجهی که از درک بومی تصویر برخوردار است و با هدف افزایش توانایی، سرعت استنتاج و امکان مقیاسپذیری توسعه یافته است.
این مدل یک معماری «ترکیب خبرگان» (MoE) با ۵۵۲ میلیارد پارامتر دارد و از پنجره زمینهای تا یک میلیون توکن پشتیبانی میکند. مدل میتواند متن و تصویر را بهصورت بومی پردازش و متن را به شکل خودبازگشتی تولید کند.
مهمترین تغییر معماری در V4.1-Flash استفاده از ساختار Causal Encoder–Decoder (CED) است. این ساختار شامل یک ترنسفورمر ۴۰ لایهای است که از یک رمزگذار علّی ۲۰ لایهای و یک رمزگشا ۲۰ لایهای تشکیل شده است. در این معماری، کش کلید-مقدار یا KV Cache مربوط به رمزگشا از حالتهای نهایی رمزگذار تولید میشود، نه از حالتهای هر لایه رمزگشا. در نتیجه، هنگام پیشپردازش ورودی تنها ۸ میلیارد پارامتر و هنگام تولید خروجی ۱۶ میلیارد پارامتر فعال میشوند. DeepSeek این طراحی را راهی برای افزایش بهرهوری هزینه، بهویژه در بارهای کاری عاملمحور و ورودیمحور، معرفی میکند.
یکی از محورهای اصلی V4.1-Flash کاهش اندازه KV Cache است. این مدل از روش SWA Bounded Replay برای بازسازی حالتهای گمشده SWA KV استفاده میکند؛ روشی که تنها آخرین بخش توکنها را بازپخش میکند و نیاز به ذخیره KV روی SSD را از بین میبرد. در نتیجه، حجم KV Cache پایدار به حدود یکهشتم مدل DeepSeek-V4-Flash کاهش یافته است.
مدل V4.1-Flash همچنین از Compressed Sparse Attention 2 (CSA2) استفاده میکند. در این روش، هر لایه توجه یکی از سه حالت ثابت Full، Reindex یا Reuse را به خود اختصاص میدهد. این طراحی امکان اشتراکگذاری KV اصلی و K مربوط به indexer میان لایهها و استفاده مجدد از شاخصهای Top-K مربوط به توجه تنک یا اسپارس را فراهم میکند. در بخش رمزگشا نیز یک Hierarchical Sparse Indexer دامنه جستوجوی لایههای بعدی را به مجموعهای از گزینهها محدود میکند که نخستین لایه Full Mode ساخته است. DeepSeek همچنین از FP4 main KV caching استفاده کرده است. ترکیب این روشها اندازه KV Cache سراسری را به ۸۹۰ بایت برای هر توکن میرساند؛ یعنی تقریباً یکچهارم DeepSeek-V4-Flash. در بخش چندوجهی نیز یک رمزگذار بینایی با نام DeepSeek-ViT که از ابتدا آموزش داده شده، تصاویر را پردازش میکند. این ادغامها از ابتدای مرحله پیشآموزش در کنار embeddingهای متنی پردازش میشوند.
DeepSeek-V4.1-Flash از ابتدا روی یک پیکره چندوجهی شامل ۴۵ تریلیون توکن آموزش داده شده است. آموزش توجه تنک در طول توالی ۶۴ هزار توکن انجام شده و سپس زمینه مدل تا یک میلیون توکن گسترش یافته است. در مرحله پساآموزش، مدل از روند استاندارد SFT → RL → on-policy distillation (OPD) استفاده میکند. تغییرات اصلی، به گفته DeepSeek، در خط لوله دادهها اعمال شدهاند؛ از جمله تولید خودکار در مقیاس بزرگ برای وظایف و محیطهای عاملمحور و افزایش تدریجی مقیاس دادهها، وظایف و rolloutها. مدل همچنین امکان کنترل پیوسته میزان تلاش برای استدلال را از ۱ تا ۱۰۰ فراهم میکند تا میان هزینه استنتاج و دقت تعادل ایجاد شود.
نتایج بنچمارکهای ارائهشده نشان میدهد V4.1-Flash در برخی آزمونها از مدلهای بزرگتر عملکرد بهتری دارد. برای نمونه، در HumanEval امتیاز ۷۹.۴، در GSM8K امتیاز ۹۳.۰ و در BigCodeBench امتیاز ۶۰.۶ ثبت کرده است. در آزمونهای عاملمحور نیز V4.1-Flash در Terminal-Bench 2.1 امتیاز ۹۰.۶، در Terminal-Bench 3.0 امتیاز ۳۰.۰ و در DeepSWE v1.1 امتیاز ۷۴.۲ به دست آورده است. در ارزیابیهای چندوجهی نیز مدل در MMMU-Pro امتیاز ۵۶.۵، در CVBench امتیاز ۷۷.۹ و در DocVQA امتیاز ۹۵.۶ کسب کرده است.

در مقایسه با مدلهای مرزی، V4.1-Flash در برخی آزمونهای عاملمحور از مدلهای مورد مقایسه، از جمله DeepSeek-V4-Pro، عملکرد بالاتری دارد. برای مثال، امتیاز آن در Terminal-Bench 2.1 برابر ۹۰.۶ و در DeepSWE v1.1 برابر ۷۴.۲ گزارش شده است.

در سطح سرویس، V4.1-Flash از ۱۰ سپتامبر ۲۰۲۶ روی API دیپسیک در دسترس قرار گرفته و از قابلیت چندوجهی بومی پشتیبانی میکند. شناسه مدل در API برابر deepseek-flash است. مدلهای V4-Flash و V4-Flash-Vision-Exp بازنشسته شدهاند و شناسههای قبلی آنها به طور موقت به V4.1-Flash هدایت میشوند.
در بخش هزینه، DeepSeek تأکید میکند که معماری جدید امکان ارائه سرویس با هزینه پایینتر را فراهم کرده است. KV Cache در مقایسه با نسل قبلی به یکچهارم HBM و یکهشتم فضای SSD نیاز دارد. ازآنجاکه هزینههای مربوط به cache-hit میتواند بخش بزرگی از هزینه عاملها را تشکیل دهد، DeepSeek کاهش حجم cache را عاملی برای کاهش هزینه معرفی میکند. همچنین نرخهای خارج از ساعات اوج مصرف، ۵۰ درصد نرخهای اوج هستند.

DeepSeek همچنین اعلام کرده است که از جامعه متنباز برای توسعه پشتیبانی استنتاج V4.1-Flash و گسترش گزینههای استقرار این مدل حمایت خواهد کرد. مدل تحت مجوز MIT منتشر شده و امکان اجرای آن با ابزارهایی مانند Transformers، vLLM، SGLang و Docker در صفحه Hugging Face ارائه شده است. صفحه مدل همچنین روشهایی برای استفاده محلی و پشتیبانی از ابزارهایی مانند llama.cpp، Ollama و LM Studio از طریق مدلهای quantized ارائه میکند.

در مجموع، DeepSeek-V4.1-Flash بر سه محور اصلی بنا شده است: معماری Causal Encoder–Decoder با تعداد پارامترهای فعال کمتر، کاهش چشمگیر KV Cache و تمرکز بر بارهای کاری عاملمحور و چندوجهی. DeepSeek این ترکیب را برای دستیابی همزمان به توانایی بیشتر، استنتاج سریعتر، گذردهی بالاتر و هزینه پایینتر ارائه کرده است.
