اولین مدل ادغام و امبدیگ ذاتاً چندوجهی گوگل
انتشار مدل Gemini Embedding 2
مدل Gemini Embedding 2، اولین مدل تعبیهسازی ذاتاً چندوجهی گوگل است که متن، تصاویر، ویدئو، صدا و اسناد را به یک فضای تعبیهشده واحد نگاشت میکند و امکان بازیابی و طبقهبندی چندوجهی در میان انواع مختلف رسانه را فراهم میکند. مدل Gemini Embedding 2 ابتدا بهصورت نسخه پیشنمایش عمومی و اکنون بهصورت دسترسی عمومی در دسترس است.
با توسعه پایه قبلی که تنها مبتنی بر متن بود، Gemini Embedding 2 متن، تصاویر، ویدئوها، صدا و اسناد را به یک فضای امبدینگ واحد و یکپارچه نگاشت میکند و قابلیت درک قصد معنایی (Semantic Intent) در بیش از ۱۰۰ زبان را دارد. این امر خطوط لوله پیچیده را سادهسازی کرده و طیف گستردهای از وظایف پاییندستی را بهبود میبخشد؛ از تولید تقویتشده با بازیابی (RAG) و جستجوی معنایی گرفته تا تحلیل احساسات و خوشهبندی دادهها.
مدالیتههای جدید و ابعاد خروجی انعطافپذیر
این مدل مبتنی بر Gemini است و از بهترین قابلیتهای درک چندوجهی در کلاس خود بهره میبرد تا ادغام باکیفیتی را در موارد زیر ایجاد کند:
- متن: پشتیبانی از زمینه گسترده تا ۸۱۹۲ توکن ورودی
- تصویر: قابلیت پردازش تا ۶ تصویر در هر درخواست، با پشتیبانی از فرمتهای PNG و JPEG
- ویدئو: پشتیبانی از حداکثر ۱۲۰ ثانیه ورودی ویدئو در فرمتهای MP4 و MOV
- صدا: دریافت و ادغام دادههای صوتی بدون نیاز به رونوشتهای متنی بهصورت بوکی
- اسناد: ادغام مستقیم فایلهای PDF تا طول ۶ صفحه
فراتر از پردازش یک مدالیته در هر زمان، این مدل ذاتاً ورودیهای درهمتنیده را درک میکند، بنابراین کاربر میتواند چندین مدل ورودی (مانند تصویر + متن) را در یک درخواست واحد ارسال کند. این ویژگی به مدل اجازه میدهد تا روابط پیچیده و ظریف بین انواع مختلف رسانه را درک کرده و فهم دقیقتری از دادههای پیچیده دنیای واقعی را ممکن سازد.
مشابه مدلهای امبدینگ قبلی گوگل، Gemini Embedding 2 از یادگیری بازنمایی ماتریوشکا (Matryoshka Representation Learning – MRL) استفاده میکند؛ تکنیکی که اطلاعات را با کاهش پویای ابعاد درون هم «لانهگزینی» (Nest) میکند. این امر ابعاد خروجی انعطافپذیری را با کاهش مقیاس از مقدار پیشفرض ۳۰۷۲ فراهم میآورد تا توسعهدهندگان بتوانند بین عملکرد و هزینههای ذخیرهسازی تعادل ایجاد کنند.
برای مشاهده عملکرد امبدینگ، نسخه نمایشی سبکوزن جستوجوی معنایی چندوجهی گوگل را امتحان کنید
عملکرد پیشرو
مدل Gemini Embedding 2 تنها مدلهای قدیمی را بهبود نمیبخشد؛ بلکه استاندارد عملکردی جدیدی را برای عمق چندوجهی ایجاد میکند، قابلیتهای گفتاری قدرتمندی را معرفی کرده و از مدلهای پیشرو در وظایف مبتنی بر متن، تصویر و ویدئو پیشی میگیرد. این بهبود قابلاندازهگیری و پوشش منحصربهفرد چندوجهی، دقیقاً همان چیزی را به توسعهدهندگان ارائه میدهد که برای نیازهای متنوع تعبیهسازی خود به آن احتیاج دارند.
مدل Gemini Embedding 2 با معنی بخشیدن به دادههای متنوع، پایه و اساس درک چندوجهی لازم و ضروری برای عصر بعدی تجربیات پیشرفته هوش مصنوعی فراهم میآورد.

شروع کار با Gemini Embedding 2
مدل Gemini Embedding 2 از طریق Gemini API و Vertex AI در دسترس است.
نحوه استفاده از این مدل را می توانید در Colabهای تعاملی Gemini API و Vertex AI و همچنین LangChain, LlamaIndex, Haystack, Weaviate, QDrant, ChromaDB و Vector Search بیاموزید.
قطعه کد زیر نمونهای از فراخوانی Gemini Embedding 2 است که گوگل پیشنهاد میکند:
from google import genai
from google.genai import types
# For Vertex AI:
# PROJECT_ID='<add_here>'
# client = genai.Client(vertexai=True, project=PROJECT_ID, location='us-central1')
client = genai.Client()
with open("example.png", "rb") as f:
image_bytes = f.read()
with open("sample.mp3", "rb") as f:
audio_bytes = f.read()
# Embed text, image, and audio
result = client.models.embed_content(
model="gemini-embedding-2-preview",
contents=[
"What is the meaning of life?",
types.Part.from_bytes(
data=image_bytes,
mime_type="image/png",
),
types.Part.from_bytes(
data=audio_bytes,
mime_type="audio/mpeg",
),
],
)
print(result.embeddings)