قابلدسترس در API برای کاربردهای عاملمحور
OpenAI از ۳ مدل هوش مصنوعی صوتی رونمایی کرد
نسل جدیدی از مدلهای صوتی بلادرنگ که میتوانند همزمان با صحبتکردن افراد، به استدلال، ترجمه و رونویسی بپردازند.
OpenAI سه مدل صوتی قابلدسترسی در API را معرفی کرد. با استفاده از این مدلها، توسعهدهندگان میتوانند تجربیات صوتی بسازند که طبیعیتر جلوه کنند، هوشمندانهتر پاسخ دهند و بهصورت بلادرنگ اقدام کنند.
GPTهای صوتی
صدا در حال تبدیلشدن به یکی از طبیعیترین راهها برای استفاده افراد از نرمافزار است. این امکان را به کاربر میدهد تا هنگام رانندگی درخواست کمک کند، برنامه سفر خود را در حین راهرفتن در فرودگاه تغییر دهد، پشتیبانی را به زبان دلخواه خود دریافت کند یا بدون توقف برای تایپکردن کارهای خود را پیش ببرد.
اما ساخت محصولات صوتی کاربردی، نیازمند چیزی بیش از نوبتگیری سریع در مکالمه یا صدای طبیعی است. یک عامل صوتی (Voice Agent) باید منظور فرد را درک کند، زمینه را حفظ کند، در صورت تغییر درخواست خود را بازیابی کند، ابزارها را در حین ادامه مکالمه به کار گیرد و بهگونهای پاسخ دهد که متناسب با لحظه باشد.
در مجموع، مدلهای جدید OpenAI، پردازش صوت را از پرسشوپاسخ ساده به سمت رابطهای صوتی میبرند که واقعاً میتوانند کاربردی باشند و وظایفی مانند گوشدادن، استدلالکردن، ترجمه، رونویسی و اقدامکردن همزمان با پیشرفت مکالمه را انجام دهند. این ۳ مدل شامل:
- GPT Realtime 2: اولین مدل صوتی OpenAI با سطح استدلال در کلاس GPT 5 که میتواند درخواستهای دشوارتر را پردازش کرده و مکالمه را به شکلی کاملاً طبیعی بهپیش ببرد.
- GPT Realtime Translate: یک مدل جدید ترجمه زنده که گفتار را از بیش از ۷۰ زبان ورودی به ۱۳ زبان خروجی و همگام با سرعت گوینده ترجمه میکند.
- GPT Realtime Whisper: یک مدل جدید تبدیل گفتار به متن که گفتار را همزمان با صحبت گوینده بهصورت زنده رونویسی میکند.
«چیزی که در مورد GPT-Realtime-2 برجسته بود، هوش و قابلیت اطمینان در فراخوانی ابزار است که به تعاملات صوتی پیچیده میآورد. در سختترین بنچمارک تخاصمی ما، این امر پس از بهینهسازی پرامپت، به معنای ارتقای ۲۶ امتیازی در نرخ موفقیت تماس است (۹۵ درصد در برابر ۶۹ درصد). ترکیب قابلیتهای عاملمحور و قدرت سازوکارهای حافظتی چیزی است که آن را برای تولید صوت در Zillow قابلدوام میسازد.»
«جاش وایزبرگ»، معاون ارشد و رئیس بخش هوش مصنوعی Zillow
صدا بهعنوان یک رابط بین افراد و محصولات
همانطور که صدا به روشی رایج برای استفاده از نرمافزار تبدیل میشود، شاهد این هستیم که توسعهدهندگان محصولات خود را حول سه الگوی نوظهور در هوش مصنوعی صوتی بنا میکنند:
- صدا به اقدام (Voice-to-action): جایی که افراد میتوانند نیازهای خود را شرح دهند و سیستم میتواند درخواست را استدلال کند، از ابزارها استفاده کند و وظیفه را تکمیل کند. برای مثال، پلتفرم Zillow در حال ساخت دستیاری است که میتواند درخواستهایی مانند: «خانههایی در محدوده توان خرید من پیدا کن، از خیابانهای شلوغ دوری کن و یک برنامه تفریحی برای روز شنبه زمانبندی کن» را بشنود، استدلال کند و بر اساس آنها اقدام کند.
- سیستمها به صدا (Systems-to-voice): جایی که نرمافزار میتواند بستر و زمینه را به راهنمایی گفتاری زنده تبدیل کند. بهعنوانمثال، یک برنامه سفر میتواند به مسافر بگوید: «پرواز ورودی تأخیر دارد، اما هنوز هم میتوانید به پرواز بعدی خود برسید. من گیت جدید را پیدا کردم، سریعترین مسیر را از طریق ترمینال نقشهبرداری کردم و چمدان شما نیز همچنان طبق برنامه منتقل خواهد شد.»
- صدا به صدا (Voice-to-voice): جایی که هوش مصنوعی میتواند به تداوم مکالمات زنده در میان زبانها، وظایف یا زمینههای در حال تغییر کمک کند. برای مثال، Deutsche Telekom در حال ساخت تجربیات پشتیبانی صوتی است که در آن مشتریان میتوانند به زبانی که با آن راحتتر هستند صحبت کنند، درحالیکه مدل، مکالمه را بهصورت لحظهای ترجمه میکند.
تقویت مدلهای صوتی برای استدلال و اقدام
مدل GPT Realtime 2 برای تعاملات صوتی زنده ساخته شده است؛ جایی که مدل درحالیکه روی یک درخواست استدلال میکند، ابزارها را فراخوانی میکند، اصلاحات یا وقفهها را مدیریت میکند و پاسخی متناسب با شرایط ارائه میدهد، مکالمه را نیز در جریان نگه میدارد.
- مقدمهها (Preambles): توسعهدهندگان میتوانند عبارات کوتاهی را قبل از پاسخ اصلی فعال کنند، مانند «اجازه بدهید آن را بررسی کنم» یا «یکلحظه صبر کنید تا به آن نگاهی بیندازم»، تا کاربران بدانند عامل در حال پردازش درخواست است.
- فراخوانی موازی ابزارها و شفافیت ابزار: مدل میتواند چندین ابزار را به طور همزمان فراخوانی کند و این اقدامات را با عباراتی مانند «در حال بررسی تقویم» یا «اکنون در حال جستجوی آن هستم» اعلام کند که به عاملها کمک میکند در حین انجام وظایف، پاسخگو باقی بمانند.
- رفتار بازیابی قویتر: مدل میتواند بهجای خاموششدن یا قطع مکالمه، با گفتن جملاتی مانند «در حال حاضر با این موضوع مشکل دارم»، به شکلی مناسبتر وضعیت خود را بازیابی کند.
- پنجره زمینه طولانیتر برای گردشکارهای عاملمحور: پنجره زمینه GPT Realtime 2 از ۳۲ هزار به ۱۲۸ هزار توکن افزایش یافته تا از جلسات طولانیتر و منسجمتر و جریانهای کاری پیچیدهتر پشتیبانی کند.
- درک عمیقتر از دامنه تخصصی: GPT Realtime 2 اصطلاحات تخصصی، اسامی خاص، اصطلاحات مراقبتهای بهداشتی و سایر واژگانی که در محیطهای تولید اهمیت دارند را بهتر حفظ میکند.
- لحن و بیان قابلکنترلتر: مدل میتواند لحن خود را بهتر تنظیم کند؛ صحبتکردن با آرامش هنگام حل یک مشکل، همدلی زمانی که کاربر ناامید است یا با خوشبینی هنگام تأیید یک اقدام موفقیتآمیز.
- استدلال قابلتنظیم: توسعهدهندگان اکنون میتوانند سطوح استدلال حداقل (minimal)، کم (low)، متوسط (medium)، زیاد (high) و بسیار زیاد (xhigh) را انتخاب کنند (با پیشفرض سطح کم)، تا بین تأخیر کمتر برای تعاملات ساده و استدلال سنجیدهتر برای درخواستهای پیچیده تعادل ایجاد کنند.
این پیشرفتها در ارزیابیهای صوتی که تطابق نزدیکی با عاملهای صوتی در محیط تولید دارند، نمایان میشوند. GPT Realtime 2 (high) در بنچمارک Big Bench Audio برای هوش صوتی، ۱۵.۲ درصد بالاتر از GPT Realtime 1.5 امتیاز میگیرد. مدل GPT Realtime 2 (xhigh) در بنچمارک Audio MultiChallenge برای پیروی از دستورالعملها، ۱۳.۸ درصد امتیاز بالاتر کسب میکند که نشاندهنده بهبود نسبت به GPT Realtime 1.5 و نمایش استدلال، مدیریت زمینه و کنترل قویتر در مکالمات زنده است.


بنچمارک Big Bench Audio، قابلیتهای استدلالی چالشبرانگیز را در مدلهایی که از ورودی صوتی پشتیبانی میکنند، ارزیابی میکند. معیار Audio MultiChallenge هوش محاورهای چند نوبته را در سیستمهای گفتوگوی صوتی از جمله پیروی از دستورالعمل، یکپارچهسازی زمینه، خودسازگاری و مدیریت اصلاحات گفتار طبیعی ارزیابی میکند.
تجربیات صوتی چندزبانه زنده
مدل GPT Realtime Translate به توسعهدهندگان کمک میکند تجربیات صوتی چندزبانه زندهای بسازند که در آن هر فرد میتواند به زبان دلخواه خود صحبت کند و ترجمه مکالمه را بهصورت بلادرنگ بشنود و رونویسیهای زنده را بخواند. این مدل از بیش از ۷۰ زبان ورودی و ۱۳ زبان خروجی پشتیبانی میکند و کاربران سازمانی آن را برای پشتیبانی مشتری، فروش برونمرزی، آموزش، رویدادها، رسانهها و پلتفرمهای تولید محتوا که به مخاطبان جهانی خدمات میدهند استفاده میکنند.
برای توسعهدهندگان، ترجمه زنده باید معنی را حفظ کند درحالیکه همگام با گوینده پیش میرود، حتی زمانی که افراد به طور طبیعی صحبت میکنند، زمینه بحث را تغییر میدهند یا از تلفظهای بومی و زبان خاص در یک حوزه خاص استفاده میکنند.
«ساخت هوش صوتی برای هند به معنای مدیریت آواشناسی متنوع منطقهای است. در ارزیابیهای ما در زبانهای هندی، تامیلی و تلوگو، GPT-Realtime-Translate نسبت به هر مدل دیگری که آزمایش کردیم، ۱۲.۵ درصد نرخ خطای کلمه (WER) پایینتری را ارائه داد، به همراه نرخهای بازگشت (Fallback) پایینتر، نرخ تکمیل وظایف بالاتر و تأخیری که مکالمه طبیعی را حفظ میکرد. این مدل استاندارد جدیدی را برای هوش مصنوعی صوتی چندزبانه تعیین میکند.»
«پراتیک ساچان» همبنیانگذار و مدیر ارشد فناوری در BolnaAI
تجربیات رونویسی با تأخیر کم
مدل GPT Realtime Whisper یک مدل رونویسی جریانی جدید است که برای تبدیل گفتار به متن با تأخیر بسیار کم ساخته شده است. این مدل همزمان با صحبتکردن افراد، صدا را رونویسی میکند، بنابراین محصولات زنده میتوانند سریعتر، پاسخگوتر و طبیعیتر احساس شوند؛ از زیرنویسهایی که در لحظه ظاهر میشوند تا یادداشتهای جلسات که همگام با مکالمه پیش میروند.
این مدل، گفتار زنده را همزمان با وقوع در داخل گردشکارهای سازمانی قابلاستفاده میکند. تیمها میتوانند زیرنویسهای جلسات، کلاسهای درس، پخشهای رسانهای و رویدادها را تولید کنند؛ یادداشتها و خلاصهها را درحالیکه مکالمات هنوز در جریان هستند تولید کنند؛ عاملهای صوتی بسازند که باید به طور مداوم کاربران را درک کنند و گردشکارهای پیگیری سریعتری را برای پشتیبانی مشتری، مراقبتهای بهداشتی، فروش، استخدام و سایر تعاملات گفتاری با حجم بالا ایجاد کنند.
ایمنی
رابط کاربری Realtime API شامل لایههای متعددی از نردههای محافظ و کاهشدهندههای ریسک برای کمک به جلوگیری از سوءاستفاده است. OpenAI طبقهبندیکنندههای فعال را روی جلسات Realtime API به کار میگیرد، به این معنی که اگر مکالمات خاصی بهعنوان نقضکننده دستورالعملهای محتوای مضر شناسایی شوند، میتوانند متوقف شوند. توسعهدهندگان همچنین میتوانند با استفاده از کیت توسعه نرمافزار عاملها (Agents SDK)، بهراحتی نردههای محافظ ایمنی اضافی خود را اضافه کنند.
قیمتگذاری و دسترسی
مدلهای GPT Realtime 2، GPT Realtime Translate و GPT Realtime Whisper در Realtime API در دسترس هستند. قیمتگذاری GPT Realtime 2 بهصورت ۳۲ دلار بهازای هر ۱ میلیون توکن صوتی ورودی و ۶۴ دلار بهازای هر ۱ میلیون توکن صوتی خروجی است (۴۰ سنت بهازای توکنهای ورودی کششده). قیمتگذاری GPT Realtime Translate برابر با ۳.۴ سنت بر دقیقه و GPT Realtime Whisper نیز ۱.۷ سنت بر دقیقه تعیین شده است.
شروع کار
میتوانید مدلهای صوتی بلادرنگ جدید را در بستر آزمایشی (Playground) تست کنید. برای توسعه نیز میتوانید این پرامپت را در Codex باز کنید تا GPT Realtime 2 را به یک برنامه موجود اضافه کنید یا یک برنامه جدید بسازید.