Gemini 3.5 Live Translate
ترجمه روان و طبیعی صدا با قابلیت ترجمه همزمان Gemini 3.5 Live Translate
مدل Gemini 3.5 Live Translate جدیدترین مدل صوتی گوگل است که امکان ترجمه گفتار به گفتار را در لحظه برای بیش از ۷۰ زبان فراهم میکند.
بیست سال پیش، پروژه Translate در گوگل بهعنوان یکی از آزمایشهای پیشگام در حوزه یادگیری ماشین آغاز شد تا علم زبان را به جادوی ارتباطات انسانی پیوند بزند. آن آزمایش اکنون مسیر طولانی و موفقی را پیموده است؛ بهطوری که امروزه ماهانه بیش از یک تریلیون کلمه برای میلیاردها کاربر در سراسر محصولات گوگل ترجمه میشود. اکنون گوگل با عرضه Gemini 3.5 Live Translate، جدیدترین مدل صوتی خود برای ترجمه همزمان گفتار به گفتار، گام بعدی را برداشته است.
پوشش بیش از ۷۰ زبان
این مدل به طور خودکار بیش از ۷۰ زبان را تشخیص میدهد و گفتار ترجمهشدهای روان و طبیعی تولید میکند که لحن (تکیه صدا)، سرعت کلام و زیروبم صدای گوینده را حفظ میکند. برخلاف سیستمهای نوبتی (Turn-by-Turn) که برای پاسخگویی منتظر میمانند تا شخص صحبت خود را تمام کند، مدل 3.5 Live Translate صدا را بهصورت مداوم و پیوسته تولید میکند؛ این مدل توازن دقیقی میان «انتظار برای دریافت زمینه جهت ارتقای کیفیت» و «ترجمه فوری برای همگام ماندن با گوینده» برقرار میکند. این فناوری، خروجی صوتی روانی را بدون وقفههای ناخوشایند ارائه میدهد و در طول تمام مدت جلسه، تنها چند ثانیه عقبتر از گوینده حرکت میکند.
گفتار همزمان
مدل Gemini 3.5 Live Translate گفتار را به همان صورت که جریان مییابد پردازش میکند و از این طریق، ارتباطی یکپارچهتر را میان زبانهای مختلف امکانپذیر میکند. این مدل ورودیهای چندزبانه را بدون نیاز به پیکربندی دستی تنظیمات مدیریت میکند. درعینحال، مقاومت این مدل در برابر نویز (Noise Robustness) تضمین میکند که برنامهها میتوانند در محیطهای شلوغ و غیرقابلپیشبینی نیز بهدرستی عمل کنند. شما میتوانید از این قابلیتها برای تسهیل فرایند ترجمه همزمان در تماسهای چندزبانه، جلسات، کلاسهای آموزشی، پخشهای زنده و موارد دیگر استفاده کنید.
نحوه عرضه
عرضه Gemini 3.5 Live Translate از امروز در سراسر محصولات گوگل آغاز شده است:
- برای توسعهدهندگان: در قالب نسخه پیشنمایش عمومی از طریق Gemini Live API و Google AI Studio.
- برای سازمانها: در قالب نسخه پیشنمایش خصوصی از ابتدای این ماه در Google Meet.
- برای عموم کاربران: از طریق اپلیکیشن Google Translate در سیستمعاملهای اندروید و iOS.
تجربه Gemini 3.5 Live Translate در جلسات
قابلیت ترجمه گفتار در Google Meet بهزودی از مدل Gemini 3.5 Live Translate استفاده خواهد کرد و تجربه کاربری را از طرق زیر بهبود میبخشد:
- پشتیبانی از بیش از ۷۰ زبان که ارتقای چشمگیری نسبت به محدودیت قبلی (تنها ۵ زبان) به شمار میرود.
- امکان برقراری گفتگو در قالب بیش از ۲۰۰۰ ترکیب زبانی در یک جلسه که توسعهیافتهشده از حالت قبلی است که در آن ترجمه صرفاً به زبان انگلیسی یا از زبان انگلیسی انجام میشد.
- بهروزرسانی رابط کاربر: جهت فراهمکردن دسترسی فوری به ترجمه گفتار.
دسترسی در اپلیکیشن Google Translate برای اندروید و iOS
این مدل همچنین در اپلیکیشن Google Translate بهصورت جهانی هم در سیستمعامل اندروید و هم iOS در حال عرضه است. هنگام استفاده از قابلیت ترجمه زنده (Live Translate)، کافی است هر نوع هدفونی را متصل کنید تا ترجمهای یکپارچهتر را تجربه کنید که لحن گوینده را در بیش از ۷۰ زبان منعکس میکند.
عرضه قابلیت جدید «حالت شنیداری» (Listening Mode) برای کاربران اندروید نیز امکان میدهد ترجمهها را به طور مستقیم از طریق بلندگوی گوشی (گوشی تلفن) بشنوید. کافی است تلفن خود را مانند یک تماس معمولی روی گوش خود نگه دارید تا صدای ترجمهشده مستقیماً پخش شود. این تجربه جدید میتواند در موقعیتهایی مفید باشد که میخواهید بهسرعت ترجمهها را بشنوید بدون اینکه دیگران آن را بشنوند و هدفون نیز در دسترس ندارید.
SynthID
تمام صداهای تولیدشده توسط مدلهای گوگل با فناوری SynthID نشانگذاری میشوند. این واترمارک غیرقابلتشخیص به طور مستقیم در خروجی صوتی بافته میشود و این اطمینان را ایجاد میکند که محتوای تولیدشده توسط هوش مصنوعی قابلشناسایی باقی بماند تا به جلوگیری از انتشار اطلاعات نادرست کمک کند.