جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 خانواده Gemma 4؛ کارآمدترین مدل‌های متن‌باز به‌ازای هر بایت

خانواده Gemma 4؛ کارآمدترین مدل‌های متن‌باز به‌ازای هر بایت

زمان مطالعه: < 1 دقیقه

گوگل DeepMind چهار مدل زبانی بزرگ استنتاجی جدید با قابلیت پردازش بینایی و تحت لایسنس Apache 2.0 را در اندازه‌های ۲، ۴ و ۳۱ میلیارد پارامتری به همراه یک مدل با معماری «ترکیب متخصصان» یا MoE (Mixture-of-Experts) با پیکربندی 26B-A4B معرفی کرده است.

گوگل دسترسی API به دو مدل بزرگ‌تر Gemma را از طریق پلتفرم AI Studio خود فراهم کرده است و همچنین وزن‌های آن در پلتفرم‌هایی مانند Kaggle، Ollama و HuggingFace در دسترس و قابل‌دانلود هستند و می‌توان آن‌ها به‌صورت آفلاین و بدون نیاز به اینترنت به کمک ابزارهای اجرای لوکال LLM مانند Ollama و LM Studio اجرا کرد.

این پیکربندی سبب شده تا نسخه‌های مخصوص مویابل و سبک این خانواده دارای پنجره زمینه ۱۲۸ هزار توکنی و نسخه‌های سنگین آن پنجره زمینه ۲۵۶ هزار توکنی داشته باشند که این امکان را به  Gemma 4 می‌دهد که درخواست‌های بسیار طولانی را در یک مرتبه پردازش کند.

گوگل به سطح بی‌سابقه‌ای از «هوش به‌ازای هر پارامتر» (Intelligence-per-parameter) دست یافته نشان می‌دهد توسعه مدل‌های کوچک و کاربردی در حال حاضر یکی از داغ‌ترین حوزه‌های پژوهشی در هوش مصنوعی است. DeepMind بر پایه تحقیقات و مطالعات Gemini، در واقع دو مدل کوچک‌تر را با عناوین E2B و E4B نام‌گذاری کرده‌اند که حرف E مخفف اندازه پارامتر «مؤثر» (Effective) است.

علاوه بر اینکه Gemma 4 توانایی درک بیش از ۱۴۰ زبان را دارد، یکی از ویژگی‌های جالب این مدل‌ها این است که آن‌ها فراتر از صرفاً پردازش تصاویر، چندوجهی (Multi-modal) هستند. تمامی مدل‌ها به‌صورت بومی ویدئو و تصاویر را پردازش می‌کنند، از وضوح‌های متغیر پشتیبانی می‌کنند و در وظایف بصری مانند تشخیص نوری نویسه‌ها (OCR) و درک نمودارها عملکردی عالی دارند. علاوه بر این، مدل‌های E2B و E4B دارای قابلیت دریافت ورودی صوتی بومی برای تشخیص و درک گفتار هستند.»

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]