جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 انتشار مدل Gemini Embedding 2

اولین مدل ادغام و امبدیگ ذاتاً چندوجهی گوگل

انتشار مدل Gemini Embedding 2

زمان مطالعه: 2 دقیقه

مدل Gemini Embedding 2، اولین مدل تعبیه‌سازی ذاتاً چندوجهی گوگل است که متن، تصاویر، ویدئو، صدا و اسناد را به یک فضای تعبیه‌شده واحد نگاشت می‌کند و امکان بازیابی و طبقه‌بندی چندوجهی در میان انواع مختلف رسانه را فراهم می‌کند. مدل Gemini Embedding 2 ابتدا به‌صورت نسخه پیش‌نمایش عمومی و اکنون به‌صورت دسترسی عمومی در دسترس است.

با توسعه پایه قبلی که تنها مبتنی بر متن بود، Gemini Embedding 2 متن، تصاویر، ویدئوها، صدا و اسناد را به یک فضای امبدینگ واحد و یکپارچه نگاشت می‌کند و قابلیت درک قصد معنایی (Semantic Intent) در بیش از ۱۰۰ زبان را دارد. این امر خطوط لوله پیچیده را ساده‌سازی کرده و طیف گسترده‌ای از وظایف پایین‌دستی را بهبود می‌بخشد؛ از تولید تقویت‌شده با بازیابی (RAG) و جستجوی معنایی گرفته تا تحلیل احساسات و خوشه‌بندی داده‌ها.

مدالیته‌های جدید و ابعاد خروجی انعطاف‌پذیر

این مدل مبتنی بر Gemini است و از بهترین قابلیت‌های درک چندوجهی در کلاس خود بهره می‌برد تا ادغام باکیفیتی را در موارد زیر ایجاد کند:

  • متن: پشتیبانی از زمینه گسترده تا ۸۱۹۲ توکن ورودی
  • تصویر: قابلیت پردازش تا ۶ تصویر در هر درخواست، با پشتیبانی از فرمت‌های PNG و JPEG
  • ویدئو: پشتیبانی از حداکثر ۱۲۰ ثانیه ورودی ویدئو در فرمت‌های MP4 و MOV
  • صدا: دریافت و ادغام داده‌های صوتی بدون نیاز به رونوشت‌های متنی به‌صورت بوکی
  • اسناد: ادغام مستقیم فایل‌های PDF تا طول ۶ صفحه

فراتر از پردازش یک مدالیته در هر زمان، این مدل ذاتاً ورودی‌های درهم‌تنیده را درک می‌کند، بنابراین کاربر می‌تواند چندین مدل ورودی (مانند تصویر + متن) را در یک درخواست واحد ارسال کند. این ویژگی به مدل اجازه می‌دهد تا روابط پیچیده و ظریف بین انواع مختلف رسانه را درک کرده و فهم دقیق‌تری از داده‌های پیچیده دنیای واقعی را ممکن سازد.

مشابه مدل‌های امبدینگ قبلی گوگل، Gemini Embedding 2 از یادگیری بازنمایی ماتریوشکا (Matryoshka Representation Learning – MRL) استفاده می‌کند؛ تکنیکی که اطلاعات را با کاهش پویای ابعاد درون هم «لانه‌گزینی» (Nest) می‌کند. این امر ابعاد خروجی انعطاف‌پذیری را با کاهش مقیاس از مقدار پیش‌فرض ۳۰۷۲ فراهم می‌آورد تا توسعه‌دهندگان بتوانند بین عملکرد و هزینه‌های ذخیره‌سازی تعادل ایجاد کنند.

برای مشاهده عملکرد امبدینگ، نسخه نمایشی سبک‌وزن جست‌وجوی معنایی چندوجهی گوگل را امتحان کنید

عملکرد پیشرو

مدل Gemini Embedding 2 تنها مدل‌های قدیمی را بهبود نمی‌بخشد؛ بلکه استاندارد عملکردی جدیدی را برای عمق چندوجهی ایجاد می‌کند، قابلیت‌های گفتاری قدرتمندی را معرفی کرده و از مدل‌های پیشرو در وظایف مبتنی بر متن، تصویر و ویدئو پیشی می‌گیرد. این بهبود قابل‌اندازه‌گیری و پوشش منحصربه‌فرد چندوجهی، دقیقاً همان چیزی را به توسعه‌دهندگان ارائه می‌دهد که برای نیازهای متنوع تعبیه‌سازی خود به آن احتیاج دارند.

مدل Gemini Embedding 2 با معنی بخشیدن به داده‌های متنوع، پایه و اساس درک چندوجهی لازم و ضروری برای عصر بعدی تجربیات پیشرفته هوش مصنوعی فراهم می‌آورد.

شروع کار با Gemini Embedding 2

مدل Gemini Embedding 2 از طریق Gemini API و Vertex AI در دسترس است.

نحوه استفاده از این مدل را می توانید در Colab‌های تعاملی Gemini API و Vertex AI و همچنین  LangChainLlamaIndexHaystackWeaviateQDrantChromaDB و Vector Search بیاموزید.

قطعه کد زیر نمونه‌ای از فراخوانی Gemini Embedding 2 است که گوگل پیشنهاد می‌کند:

from google import genai
from google.genai import types

# For Vertex AI:
# PROJECT_ID='<add_here>'
# client = genai.Client(vertexai=True, project=PROJECT_ID, location='us-central1')

client = genai.Client()

with open("example.png", "rb") as f:
    image_bytes = f.read()

with open("sample.mp3", "rb") as f:
    audio_bytes = f.read()

# Embed text, image, and audio 
result = client.models.embed_content(
    model="gemini-embedding-2-preview",
    contents=[
        "What is the meaning of life?",
        types.Part.from_bytes(
            data=image_bytes,
            mime_type="image/png",
        ),
        types.Part.from_bytes(
            data=audio_bytes,
            mime_type="audio/mpeg",
        ),
    ],
)

print(result.embeddings)

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]