EmbeddingGemma 2
EmbeddingGemma 2؛ مدل متنباز چندوجهی گوگل که حتی روی موبایل اجرا میشود
گوگل EmbeddingGemma 2 را بهعنوان یک مدل سبک و متنباز برای تولید امبدینگهای چندوجهی برای اجرای لوکال روی دستگاه معرفی کرد.
این مدل میتواند ترکیبی از متن، تصویر، صوت و ویدئو را بهصورت لوکال در یک فضای embedding مشترک نگاشت کند. EmbeddingGemma 2 بر پایه معماری Gemma 4 ساخته شده و با مجوز تجاری Apache 2.0 عرضه میشود. این مدل ۷۴۰ میلیون پارامتر دارد و برای اجرای استنتاج روی دستگاه بهصورت لوکال طراحی شده است.
موفقیت با ۲۰ میلیون دانلود
نسخه نخست EmbeddingGemma که سال گذشته معرفی شد، گزینهای سبک برای تولید جاسازیهای باکیفیت متنی بود و برای سازماندهی، جستوجو و ارتباط میان اطلاعات روی سختافزارهای مصرفی استفاده میشد. به گفته گوگل، این مدل بیش از ۲۰ میلیون بار دانلود شده و در ابزارهای جستوجوی روی دستگاه و خطوط لوله تولید تقویتشده با بازیابی (RAG) با تمرکز بر حفظ حریم خصوصی بهکاررفته است.
سطح جدید عملکرد با EmbeddingGemma 2
EmbeddingGemma 2 دامنه این قابلیتها را از متن فراتر میبرد و کد، تصویر، ویدئو و صوت را نیز در یک فضای امبدینگ مشترک قرار میدهد. در نتیجه، یک مدل چندوجهی میتواند برای نمونه، یک کلیپ ویدئویی مشخص را بر اساس یک یادداشت صوتی پیدا کند یا ساعتها فایل صوتی را با استفاده از یک پرسوجوی متنی جستوجو کند.
این مدل در میان مدلهای چندوجهی با کمتر از یک میلیارد پارامتر، عملکرد بالایی ارائه میکند و در معیارهایی مانند MTEB Code و MAEB امتیازهای پیشرو به دست آورده است. EmbeddingGemma 2 همچنین از نظر عملکرد در وظایف متنی، بینایی و صوتی با بسیاری از مدلهای بزرگتر رقابت میکند یا از آنها بهتر است.



یکی از ویژگیهای مدل، طراحی ماژولار آن است. برای پردازش صرفاً متنی، میتوان از نسخهای با حداقل ۲۷۰ میلیون پارامتر استفاده کرد و برای پشتیبانی کامل چندوجهی، انکودرهای اختیاری بینایی با ۱۷۰ میلیون و صوت با ۳۰۰ میلیون پارامتر به آن افزود.
EmbeddingGemma 2 همچنین برای کاهش هزینه ذخیرهسازی بهینه شده است. با استفاده از Matryoshka Representation Learning (MRL)، بردارهای خروجی ۷۶۸بعدی را میتوان بهصورت پویا به ۵۱۲، ۲۵۶ یا ۱۲۸ بعد کاهش داد. گوگل میگوید این قابلیت میتواند فضای موردنیاز پایگاههای داده برداری محلی و حافظه را تا ۶ برابر کاهش دهد.
اجرا حتی روی موبایل
این مدل برای اجرا با محدودیتهای منابع سختافزاری نیز بهینه شده است. پس از quantization، روی Google Pixel 11 Pro، مصرف RAM فعال برای وزنهای متنی به حدود ۱۹۱ مگابایت و برای مدل کاملاً چندوجهی به حدود ۵۶۷ مگابایت میرسد.
EmbeddingGemma 2 یک پنجره زمینه هشتهزار توکنی دارد؛ ظرفیتی که چهار برابر EmbeddingGemma 1 است. این مدل میتواند روی سختافزار لوکال تا ۵.۵ دقیقه صوت، ۲۹ تصویر، ۵۸ فریم ویدئو یا ترکیبی از این ورودیها را پردازش کند.
در حوزه کدنویسی، EmbeddingGemma 2 نسبت به نسخه قبلی ۹.۹۲ امتیاز پیشرفت در MTEB Code داشته و امتیاز آن از ۶۸.۷۶ به ۷۸.۶۸ رسیده است. این قابلیت برای نمایهسازی محلی کدبیس، جستوجوی معنایی کد و بازیابی اطلاعات برای عاملهای کدنویسی مناسب است. مدل EmbeddingGemma 2 در حوزههای تصویر، ویدئو، اسناد و صوت نیز نسبت کیفیت به تعداد پارامتر بالایی ارائه میکند و از برخی مدلهای تخصصی بیش از دو برابر بزرگتر عملکرد بهتری دارد.
اجرای امبدینگها بهصورت لوکال میتواند به حفظ حریم خصوصی دادهها، کاهش تأخیر فرایندها و ساخت سیستمهای جستوجو و بازیابی چندوجهی کاملاً آفلاین کمک کند. در ترکیب با مدلهای مولد مانند Gemma 4، EmbeddingGemma 2 امکان ساخت جریانهای کاری RAG روی دستگاه را فراهم میکند. این دو مدل توکنایزر متنی و انکودر صوتی مشترکی دارند که به کاهش مجموع حافظه موردنیاز در یک جریان کاری یکپارچه کمک میکند. از منظر فناوری، مدل مذکور بر پایهی همان فناوری مدلهای Gemini Embedding توسعه یافته است.
خانواده Gemma 4؛ کارآمدترین مدلهای متنباز بهازای هر بایت
شتابدهی به Gemma 4: استنتاج سریعتر با پیشنویسهای پیشبینی چندتوکنی
دسترسی و دانلود رایگان مدل متنباز EmbeddingGemma 2
مدلهای EmbeddingGemma 2 از طریق GitHub، Hugging Face و Kaggle در دسترس هستند.
برای استقرار روی دستگاه میتوان از Google AI Edge MediaPipe و LiteRT استفاده کرد و برای اجرای مدل در مرورگر نیز ابزارهایی مانند transformers.js و WebGPU ارائه شدهاند.
همچنین ابزارهایی مانند transformers، sentence-transformers، MLX، vLLM، llama.cpp، SGLang، Ollama و LMStudio برای سرویسدهی مدل پشتیبانی میشوند.
گوگل همچنین مستدات فنی مدل EmbeddingGemma 2 و راهنمای توسعهدهندگان را به همراه راهنمای فاینتیونینگ مدل برای استنتاج را از طریق Unsloth ارائه کرده است.