جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 ترجمه روان و طبیعی صدا با قابلیت ترجمه هم‌زمان Gemini 3.5 Live Translate

Gemini 3.5 Live Translate

ترجمه روان و طبیعی صدا با قابلیت ترجمه هم‌زمان Gemini 3.5 Live Translate

زمان مطالعه: 3 دقیقه

مدل Gemini 3.5 Live Translate جدیدترین مدل صوتی گوگل است که امکان ترجمه گفتار به گفتار را در لحظه برای بیش از ۷۰ زبان فراهم می‌کند.

بیست سال پیش، پروژه Translate در گوگل به‌عنوان یکی از آزمایش‌های پیشگام در حوزه یادگیری ماشین آغاز شد تا علم زبان را به جادوی ارتباطات انسانی پیوند بزند. آن آزمایش اکنون مسیر طولانی و موفقی را پیموده است؛ به‌طوری که امروزه ماهانه بیش از یک تریلیون کلمه برای میلیاردها کاربر در سراسر محصولات گوگل ترجمه می‌شود. اکنون گوگل با عرضه Gemini 3.5 Live Translate، جدیدترین مدل صوتی خود برای ترجمه هم‌زمان گفتار به گفتار، گام بعدی را برداشته است.

پوشش بیش از ۷۰ زبان

این مدل به طور خودکار بیش از ۷۰ زبان را تشخیص می‌دهد و گفتار ترجمه‌شده‌ای روان و طبیعی تولید می‌کند که لحن (تکیه صدا)، سرعت کلام و زیروبم صدای گوینده را حفظ می‌کند. برخلاف سیستم‌های نوبتی (Turn-by-Turn) که برای پاسخگویی منتظر می‌مانند تا شخص صحبت خود را تمام کند، مدل 3.5 Live Translate صدا را به‌صورت مداوم و پیوسته تولید می‌کند؛ این مدل توازن دقیقی میان «انتظار برای دریافت زمینه جهت ارتقای کیفیت» و «ترجمه فوری برای همگام ماندن با گوینده» برقرار می‌کند. این فناوری، خروجی صوتی روانی را بدون وقفه‌های ناخوشایند ارائه می‌دهد و در طول تمام مدت جلسه، تنها چند ثانیه عقب‌تر از گوینده حرکت می‌کند.

گفتار هم‌زمان

مدل Gemini 3.5 Live Translate گفتار را به همان صورت که جریان می‌یابد پردازش می‌کند و از این طریق، ارتباطی یکپارچه‌تر را میان زبان‌های مختلف امکان‌پذیر می‌کند. این مدل ورودی‌های چندزبانه را بدون نیاز به پیکربندی دستی تنظیمات مدیریت می‌کند. درعین‌حال، مقاومت این مدل در برابر نویز (Noise Robustness) تضمین می‌کند که برنامه‌ها می‌توانند در محیط‌های شلوغ و غیرقابل‌پیش‌بینی نیز به‌درستی عمل کنند. شما می‌توانید از این قابلیت‌ها برای تسهیل فرایند ترجمه هم‌زمان در تماس‌های چندزبانه، جلسات، کلاس‌های آموزشی، پخش‌های زنده و موارد دیگر استفاده کنید.

نحوه عرضه

عرضه Gemini 3.5 Live Translate از امروز در سراسر محصولات گوگل آغاز شده است:

  • برای توسعه‌دهندگان: در قالب نسخه پیش‌نمایش عمومی از طریق Gemini Live API و Google AI Studio.
  • برای سازمان‌ها: در قالب نسخه پیش‌نمایش خصوصی از ابتدای این ماه در Google Meet.
  • برای عموم کاربران: از طریق اپلیکیشن Google Translate در سیستم‌عامل‌های اندروید و iOS.

تجربه Gemini 3.5 Live Translate در جلسات

قابلیت ترجمه گفتار در Google Meet به‌زودی از مدل Gemini 3.5 Live Translate استفاده خواهد کرد و تجربه کاربری را از طرق زیر بهبود می‌بخشد:

  • پشتیبانی از بیش از ۷۰ زبان که ارتقای چشمگیری نسبت به محدودیت قبلی (تنها ۵ زبان) به شمار می‌رود.
  • امکان برقراری گفتگو در قالب بیش از ۲۰۰۰ ترکیب زبانی در یک جلسه که توسعه‌یافته‌شده از حالت قبلی است که در آن ترجمه صرفاً به زبان انگلیسی یا از زبان انگلیسی انجام می‌شد.
  • به‌روزرسانی رابط کاربر: جهت فراهم‌کردن دسترسی فوری به ترجمه گفتار.

دسترسی در اپلیکیشن Google Translate برای اندروید و iOS

این مدل همچنین در اپلیکیشن Google Translate به‌صورت جهانی هم در سیستم‌عامل اندروید و هم iOS در حال عرضه است. هنگام استفاده از قابلیت ترجمه زنده (Live Translate)، کافی است هر نوع هدفونی را متصل کنید تا ترجمه‌ای یکپارچه‌تر را تجربه کنید که لحن گوینده را در بیش از ۷۰ زبان منعکس می‌کند.

عرضه قابلیت جدید «حالت شنیداری» (Listening Mode) برای کاربران اندروید نیز امکان می‌دهد ترجمه‌ها را به طور مستقیم از طریق بلندگوی گوشی (گوشی تلفن) بشنوید. کافی است تلفن خود را مانند یک تماس معمولی روی گوش خود نگه دارید تا صدای ترجمه‌شده مستقیماً پخش شود. این تجربه جدید می‌تواند در موقعیت‌هایی مفید باشد که می‌خواهید به‌سرعت ترجمه‌ها را بشنوید بدون اینکه دیگران آن را بشنوند و هدفون نیز در دسترس ندارید.

SynthID

تمام صداهای تولیدشده توسط مدل‌های گوگل با فناوری SynthID نشان‌گذاری می‌شوند. این واترمارک غیرقابل‌تشخیص به طور مستقیم در خروجی صوتی بافته می‌شود و این اطمینان را ایجاد می‌کند که محتوای تولیدشده توسط هوش مصنوعی قابل‌شناسایی باقی بماند تا به جلوگیری از انتشار اطلاعات نادرست کمک کند.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]