خانواده Gemma 4؛ کارآمدترین مدلهای متنباز بهازای هر بایت
گوگل DeepMind چهار مدل زبانی بزرگ استنتاجی جدید با قابلیت پردازش بینایی و تحت لایسنس Apache 2.0 را در اندازههای ۲، ۴ و ۳۱ میلیارد پارامتری به همراه یک مدل با معماری «ترکیب متخصصان» یا MoE (Mixture-of-Experts) با پیکربندی 26B-A4B معرفی کرده است.
گوگل دسترسی API به دو مدل بزرگتر Gemma را از طریق پلتفرم AI Studio خود فراهم کرده است و همچنین وزنهای آن در پلتفرمهایی مانند Kaggle، Ollama و HuggingFace در دسترس و قابلدانلود هستند و میتوان آنها بهصورت آفلاین و بدون نیاز به اینترنت به کمک ابزارهای اجرای لوکال LLM مانند Ollama و LM Studio اجرا کرد.
این پیکربندی سبب شده تا نسخههای مخصوص مویابل و سبک این خانواده دارای پنجره زمینه ۱۲۸ هزار توکنی و نسخههای سنگین آن پنجره زمینه ۲۵۶ هزار توکنی داشته باشند که این امکان را به Gemma 4 میدهد که درخواستهای بسیار طولانی را در یک مرتبه پردازش کند.
گوگل به سطح بیسابقهای از «هوش بهازای هر پارامتر» (Intelligence-per-parameter) دست یافته نشان میدهد توسعه مدلهای کوچک و کاربردی در حال حاضر یکی از داغترین حوزههای پژوهشی در هوش مصنوعی است. DeepMind بر پایه تحقیقات و مطالعات Gemini، در واقع دو مدل کوچکتر را با عناوین E2B و E4B نامگذاری کردهاند که حرف E مخفف اندازه پارامتر «مؤثر» (Effective) است.
علاوه بر اینکه Gemma 4 توانایی درک بیش از ۱۴۰ زبان را دارد، یکی از ویژگیهای جالب این مدلها این است که آنها فراتر از صرفاً پردازش تصاویر، چندوجهی (Multi-modal) هستند. تمامی مدلها بهصورت بومی ویدئو و تصاویر را پردازش میکنند، از وضوحهای متغیر پشتیبانی میکنند و در وظایف بصری مانند تشخیص نوری نویسهها (OCR) و درک نمودارها عملکردی عالی دارند. علاوه بر این، مدلهای E2B و E4B دارای قابلیت دریافت ورودی صوتی بومی برای تشخیص و درک گفتار هستند.»