Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
جیتکس ترکیه
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 EmbeddingGemma 2؛ مدل متن‌باز چندوجهی گوگل که حتی روی موبایل اجرا می‌شود

EmbeddingGemma 2

EmbeddingGemma 2؛ مدل متن‌باز چندوجهی گوگل که حتی روی موبایل اجرا می‌شود

زمان مطالعه: 3 دقیقه

گوگل EmbeddingGemma 2 را به‌عنوان یک مدل سبک و متن‌باز برای تولید امبدینگ‌های چندوجهی برای اجرای لوکال روی دستگاه معرفی کرد.

این مدل می‌تواند ترکیبی از متن، تصویر، صوت و ویدئو را به‌صورت لوکال در یک فضای embedding مشترک نگاشت کند. EmbeddingGemma 2 بر پایه معماری Gemma 4 ساخته شده و با مجوز تجاری Apache 2.0 عرضه می‌شود. این مدل ۷۴۰ میلیون پارامتر دارد و برای اجرای استنتاج روی دستگاه به‌صورت لوکال طراحی شده است.

موفقیت با ۲۰ میلیون دانلود

نسخه نخست EmbeddingGemma که سال گذشته معرفی شد، گزینه‌ای سبک برای تولید جاسازی‌های باکیفیت متنی بود و برای سازمان‌دهی، جست‌وجو و ارتباط میان اطلاعات روی سخت‌افزارهای مصرفی استفاده می‌شد. به گفته گوگل، این مدل بیش از ۲۰ میلیون بار دانلود شده و در ابزارهای جست‌وجوی روی دستگاه و خطوط لوله تولید تقویت‌شده با بازیابی (RAG) با تمرکز بر حفظ حریم خصوصی به‌کاررفته است.

سطح جدید عملکرد با EmbeddingGemma 2

EmbeddingGemma 2 دامنه این قابلیت‌ها را از متن فراتر می‌برد و کد، تصویر، ویدئو و صوت را نیز در یک فضای امبدینگ مشترک قرار می‌دهد. در نتیجه، یک مدل چندوجهی می‌تواند برای نمونه، یک کلیپ ویدئویی مشخص را بر اساس یک یادداشت صوتی پیدا کند یا ساعت‌ها فایل صوتی را با استفاده از یک پرس‌وجوی متنی جست‌وجو کند.

EmbeddingGemma 2 model card

این مدل در میان مدل‌های چندوجهی با کمتر از یک میلیارد پارامتر، عملکرد بالایی ارائه می‌کند و در معیارهایی مانند MTEB Code و MAEB امتیازهای پیشرو به دست آورده است. EmbeddingGemma 2 همچنین از نظر عملکرد در وظایف متنی، بینایی و صوتی با بسیاری از مدل‌های بزرگ‌تر رقابت می‌کند یا از آن‌ها بهتر است.

یکی از ویژگی‌های مدل، طراحی ماژولار آن است. برای پردازش صرفاً متنی، می‌توان از نسخه‌ای با حداقل ۲۷۰ میلیون پارامتر استفاده کرد و برای پشتیبانی کامل چندوجهی، انکودرهای اختیاری بینایی با ۱۷۰ میلیون و صوت با ۳۰۰ میلیون پارامتر به آن افزود.

EmbeddingGemma 2 همچنین برای کاهش هزینه ذخیره‌سازی بهینه شده است. با استفاده از Matryoshka Representation Learning (MRL)، بردارهای خروجی ۷۶۸بعدی را می‌توان به‌صورت پویا به ۵۱۲، ۲۵۶ یا ۱۲۸ بعد کاهش داد. گوگل می‌گوید این قابلیت می‌تواند فضای موردنیاز پایگاه‌های داده برداری محلی و حافظه را تا ۶ برابر کاهش دهد.

اجرا حتی روی موبایل

این مدل برای اجرا با محدودیت‌های منابع سخت‌افزاری نیز بهینه شده است. پس از quantization، روی Google Pixel 11 Pro، مصرف RAM فعال برای وزن‌های متنی به حدود ۱۹۱ مگابایت و برای مدل کاملاً چندوجهی به حدود ۵۶۷ مگابایت می‌رسد.

EmbeddingGemma 2 یک پنجره زمینه هشت‌هزار توکنی دارد؛ ظرفیتی که چهار برابر EmbeddingGemma 1 است. این مدل می‌تواند روی سخت‌افزار لوکال تا ۵.۵ دقیقه صوت، ۲۹ تصویر، ۵۸ فریم ویدئو یا ترکیبی از این ورودی‌ها را پردازش کند.

در حوزه کدنویسی، EmbeddingGemma 2 نسبت به نسخه قبلی ۹.۹۲ امتیاز پیشرفت در MTEB Code داشته و امتیاز آن از ۶۸.۷۶ به ۷۸.۶۸ رسیده است. این قابلیت برای نمایه‌سازی محلی کدبیس، جست‌وجوی معنایی کد و بازیابی اطلاعات برای عامل‌های کدنویسی مناسب است. مدل EmbeddingGemma 2 در حوزه‌های تصویر، ویدئو، اسناد و صوت نیز نسبت کیفیت به تعداد پارامتر بالایی ارائه می‌کند و از برخی مدل‌های تخصصی بیش از دو برابر بزرگ‌تر عملکرد بهتری دارد.

اجرای امبدینگ‌ها به‌صورت لوکال می‌تواند به حفظ حریم خصوصی داده‌ها، کاهش تأخیر فرایندها و ساخت سیستم‌های جست‌وجو و بازیابی چندوجهی کاملاً آفلاین کمک کند. در ترکیب با مدل‌های مولد مانند Gemma 4، EmbeddingGemma 2 امکان ساخت جریان‌های کاری RAG روی دستگاه را فراهم می‌کند. این دو مدل توکنایزر متنی و انکودر صوتی مشترکی دارند که به کاهش مجموع حافظه موردنیاز در یک جریان کاری یکپارچه کمک می‌کند. از منظر فناوری، مدل مذکور بر پایه‌ی همان فناوری مدل‌های Gemini Embedding  توسعه یافته است.

خانواده Gemma 4؛ کارآمدترین مدل‌های متن‌باز به‌ازای هر بایت

شتاب‌دهی به Gemma 4: استنتاج سریع‌تر با پیش‌نویس‌های پیش‌بینی چندتوکنی

گوگل یک دستگاه مترجم هوش مصنوعی قابل‌حمل و آفلاین توسعه داده که شما هم می‌توانید نمونه‌ای از آن را بسازید

انتشار مدل Gemini Embedding 2

دسترسی و دانلود رایگان مدل متن‌باز EmbeddingGemma 2

مدل‌های EmbeddingGemma 2 از طریق GitHub، Hugging Face و Kaggle در دسترس هستند.

برای استقرار روی دستگاه می‌توان از Google AI Edge MediaPipe و LiteRT استفاده کرد و برای اجرای مدل در مرورگر نیز ابزارهایی مانند transformers.js و WebGPU ارائه شده‌اند.

همچنین ابزارهایی مانند transformers، sentence-transformers، MLX، vLLM، llama.cpp، SGLang، Ollama و LMStudio برای سرویس‌دهی مدل پشتیبانی می‌شوند.

گوگل همچنین مستدات فنی مدل EmbeddingGemma 2 و راهنمای توسعه‌دهندگان را به همراه راهنمای فاین‌تیونینگ مدل برای استنتاج را از طریق Unsloth ارائه کرده است.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]