جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 OpenAI از ۳ مدل هوش مصنوعی صوتی رونمایی کرد

قابل‌دسترس در API برای کاربردهای عامل‌محور

OpenAI از ۳ مدل هوش مصنوعی صوتی رونمایی کرد

زمان مطالعه: 6 دقیقه

نسل جدیدی از مدل‌های صوتی بلادرنگ که می‌توانند هم‌زمان با صحبت‌کردن افراد، به استدلال، ترجمه و رونویسی بپردازند.

OpenAI سه مدل صوتی قابل‌دسترسی در API را معرفی کرد. با استفاده از این مدل‌ها، توسعه‌دهندگان می‌توانند تجربیات صوتی بسازند که طبیعی‌تر جلوه کنند، هوشمندانه‌تر پاسخ دهند و به‌صورت بلادرنگ اقدام کنند.

GPTهای صوتی

صدا در حال تبدیل‌شدن به یکی از طبیعی‌ترین راه‌ها برای استفاده افراد از نرم‌افزار است. این امکان را به کاربر می‌دهد تا هنگام رانندگی درخواست کمک کند، برنامه سفر خود را در حین راه‌رفتن در فرودگاه تغییر دهد، پشتیبانی را به زبان دلخواه خود دریافت کند یا بدون توقف برای تایپ‌کردن کارهای خود را پیش ببرد.

اما ساخت محصولات صوتی کاربردی، نیازمند چیزی بیش از نوبت‌گیری سریع در مکالمه یا صدای طبیعی است. یک عامل صوتی (Voice Agent) باید منظور فرد را درک کند، زمینه را حفظ کند، در صورت تغییر درخواست خود را بازیابی کند، ابزارها را در حین ادامه مکالمه به کار گیرد و به‌گونه‌ای پاسخ دهد که متناسب با لحظه باشد.

در مجموع، مدل‌های جدید OpenAI، پردازش صوت را از پرسش‌وپاسخ ساده به سمت رابط‌های صوتی می‌برند که واقعاً می‌توانند کاربردی باشند و وظایفی مانند گوش‌دادن، استدلال‌کردن، ترجمه، رونویسی و اقدام‌کردن هم‌زمان با پیشرفت مکالمه را انجام دهند. این ۳ مدل شامل:

  • GPT Realtime 2: اولین مدل صوتی OpenAI با سطح استدلال در کلاس GPT 5 که می‌تواند درخواست‌های دشوارتر را پردازش کرده و مکالمه را به شکلی کاملاً طبیعی به‌پیش ببرد.
  • GPT Realtime Translate: یک مدل جدید ترجمه زنده که گفتار را از بیش از ۷۰ زبان ورودی به ۱۳ زبان خروجی و همگام با سرعت گوینده ترجمه می‌کند.
  • GPT Realtime Whisper: یک مدل جدید تبدیل گفتار به متن که گفتار را هم‌زمان با صحبت گوینده به‌صورت زنده رونویسی می‌کند.

«چیزی که در مورد GPT-Realtime-2 برجسته بود، هوش و قابلیت اطمینان در فراخوانی ابزار است که به تعاملات صوتی پیچیده می‌آورد. در سخت‌ترین بنچمارک تخاصمی ما، این امر پس از بهینه‌سازی پرامپت، به معنای ارتقای ۲۶ امتیازی در نرخ موفقیت تماس است (۹۵ درصد در برابر ۶۹ درصد). ترکیب قابلیت‌های عامل‌محور و قدرت سازوکارهای حافظتی چیزی است که آن را برای تولید صوت در Zillow قابل‌دوام می‌سازد.»
«جاش وایزبرگ»، معاون ارشد و رئیس بخش هوش مصنوعی Zillow

صدا به‌عنوان یک رابط بین افراد و محصولات

همان‌طور که صدا به روشی رایج برای استفاده از نرم‌افزار تبدیل می‌شود، شاهد این هستیم که توسعه‌دهندگان محصولات خود را حول سه الگوی نوظهور در هوش مصنوعی صوتی بنا می‌کنند:

  • صدا به اقدام (Voice-to-action): جایی که افراد می‌توانند نیازهای خود را شرح دهند و سیستم می‌تواند درخواست را استدلال کند، از ابزارها استفاده کند و وظیفه را تکمیل کند. برای مثال، پلتفرم Zillow در حال ساخت دستیاری است که می‌تواند درخواست‌هایی مانند: «خانه‌هایی در محدوده توان خرید من پیدا کن، از خیابان‌های شلوغ دوری کن و یک برنامه تفریحی برای روز شنبه زمان‌بندی کن» را بشنود، استدلال کند و بر اساس آن‌ها اقدام کند.
  • سیستم‌ها به صدا (Systems-to-voice): جایی که نرم‌افزار می‌تواند بستر و زمینه را به راهنمایی گفتاری زنده تبدیل کند. به‌عنوان‌مثال، یک برنامه سفر می‌تواند به مسافر بگوید: «پرواز ورودی تأخیر دارد، اما هنوز هم می‌توانید به پرواز بعدی خود برسید. من گیت جدید را پیدا کردم، سریع‌ترین مسیر را از طریق ترمینال نقشه‌برداری کردم و چمدان شما نیز همچنان طبق برنامه منتقل خواهد شد.»
  • صدا به صدا (Voice-to-voice): جایی که هوش مصنوعی می‌تواند به تداوم مکالمات زنده در میان زبان‌ها، وظایف یا زمینه‌های در حال تغییر کمک کند. برای مثال، Deutsche Telekom در حال ساخت تجربیات پشتیبانی صوتی است که در آن مشتریان می‌توانند به زبانی که با آن راحت‌تر هستند صحبت کنند، درحالی‌که مدل، مکالمه را به‌صورت لحظه‌ای ترجمه می‌کند.

تقویت مدل‌های صوتی برای استدلال و اقدام

مدل GPT Realtime 2 برای تعاملات صوتی زنده ساخته شده است؛ جایی که مدل درحالی‌که روی یک درخواست استدلال می‌کند، ابزارها را فراخوانی می‌کند، اصلاحات یا وقفه‌ها را مدیریت می‌کند و پاسخی متناسب با شرایط ارائه می‌دهد، مکالمه را نیز در جریان نگه می‌دارد.

  • مقدمه‌ها (Preambles): توسعه‌دهندگان می‌توانند عبارات کوتاهی را قبل از پاسخ اصلی فعال کنند، مانند «اجازه بدهید آن را بررسی کنم» یا «یک‌لحظه صبر کنید تا به آن نگاهی بیندازم»، تا کاربران بدانند عامل در حال پردازش درخواست است.
  • فراخوانی موازی ابزارها و شفافیت ابزار: مدل می‌تواند چندین ابزار را به طور هم‌زمان فراخوانی کند و این اقدامات را با عباراتی مانند «در حال بررسی تقویم» یا «اکنون در حال جستجوی آن هستم» اعلام کند که به عامل‌ها کمک می‌کند در حین انجام وظایف، پاسخ‌گو باقی بمانند.
  • رفتار بازیابی قوی‌تر: مدل می‌تواند به‌جای خاموش‌شدن یا قطع مکالمه، با گفتن جملاتی مانند «در حال حاضر با این موضوع مشکل دارم»، به شکلی مناسب‌تر وضعیت خود را بازیابی کند.
  • پنجره زمینه طولانی‌تر برای گردش‌کارهای عامل‌محور: پنجره زمینه GPT Realtime 2 از ۳۲ هزار به ۱۲۸ هزار توکن افزایش یافته تا از جلسات طولانی‌تر و منسجم‌تر و جریان‌های کاری پیچیده‌تر پشتیبانی کند.
  • درک عمیق‌تر از دامنه تخصصی: GPT Realtime 2 اصطلاحات تخصصی، اسامی خاص، اصطلاحات مراقبت‌های بهداشتی و سایر واژگانی که در محیط‌های تولید اهمیت دارند را بهتر حفظ می‌کند.
  • لحن و بیان قابل‌کنترل‌تر: مدل می‌تواند لحن خود را بهتر تنظیم کند؛ صحبت‌کردن با آرامش هنگام حل یک مشکل، همدلی زمانی که کاربر ناامید است یا با خوش‌بینی هنگام تأیید یک اقدام موفقیت‌آمیز.
  • استدلال قابل‌تنظیم: توسعه‌دهندگان اکنون می‌توانند سطوح استدلال حداقل (minimal)، کم (low)، متوسط (medium)، زیاد (high) و بسیار زیاد (xhigh) را انتخاب کنند (با پیش‌فرض سطح کم)، تا بین تأخیر کمتر برای تعاملات ساده و استدلال سنجیده‌تر برای درخواست‌های پیچیده تعادل ایجاد کنند.

این پیشرفت‌ها در ارزیابی‌های صوتی که تطابق نزدیکی با عامل‌های صوتی در محیط تولید دارند، نمایان می‌شوند. GPT Realtime 2 (high) در بنچمارک Big Bench Audio برای هوش صوتی، ۱۵.۲ درصد بالاتر از GPT Realtime 1.5 امتیاز می‌گیرد. مدل GPT Realtime 2 (xhigh) در بنچمارک Audio MultiChallenge برای پیروی از دستورالعمل‌ها، ۱۳.۸ درصد امتیاز بالاتر کسب می‌کند که نشان‌دهنده بهبود نسبت به GPT Realtime 1.5 و نمایش استدلال، مدیریت زمینه و کنترل قوی‌تر در مکالمات زنده است.

بنچمارک Big Bench Audio، قابلیت‌های استدلالی چالش‌برانگیز را در مدل‌هایی که از ورودی صوتی پشتیبانی می‌کنند، ارزیابی می‌کند. معیار Audio MultiChallenge هوش محاوره‌ای چند نوبته را در سیستم‌های گفت‌وگوی صوتی از جمله پیروی از دستورالعمل، یکپارچه‌سازی زمینه، خودسازگاری و مدیریت اصلاحات گفتار طبیعی ارزیابی می‌کند.

تجربیات صوتی چندزبانه زنده

مدل GPT Realtime Translate به توسعه‌دهندگان کمک می‌کند تجربیات صوتی چندزبانه زنده‌ای بسازند که در آن هر فرد می‌تواند به زبان دلخواه خود صحبت کند و ترجمه مکالمه را به‌صورت بلادرنگ بشنود و رونویسی‌های زنده را بخواند. این مدل از بیش از ۷۰ زبان ورودی و ۱۳ زبان خروجی پشتیبانی می‌کند و کاربران سازمانی آن را برای پشتیبانی مشتری، فروش برون‌مرزی، آموزش، رویدادها، رسانه‌ها و پلتفرم‌های تولید محتوا که به مخاطبان جهانی خدمات می‌دهند استفاده می‌کنند.

برای توسعه‌دهندگان، ترجمه زنده باید معنی را حفظ کند درحالی‌که همگام با گوینده پیش می‌رود، حتی زمانی که افراد به طور طبیعی صحبت می‌کنند، زمینه بحث را تغییر می‌دهند یا از تلفظ‌های بومی و زبان خاص در یک حوزه خاص استفاده می‌کنند.

«ساخت هوش صوتی برای هند به معنای مدیریت آواشناسی متنوع منطقه‌ای است. در ارزیابی‌های ما در زبان‌های هندی، تامیلی و تلوگو، GPT-Realtime-Translate نسبت به هر مدل دیگری که آزمایش کردیم، ۱۲.۵ درصد نرخ خطای کلمه (WER) پایین‌تری را ارائه داد، به همراه نرخ‌های بازگشت (Fallback) پایین‌تر، نرخ تکمیل وظایف بالاتر و تأخیری که مکالمه طبیعی را حفظ می‌کرد. این مدل استاندارد جدیدی را برای هوش مصنوعی صوتی چندزبانه تعیین می‌کند.»
«پراتیک ساچان» هم‌بنیان‌گذار و مدیر ارشد فناوری در BolnaAI

تجربیات رونویسی با تأخیر کم

مدل GPT Realtime Whisper یک مدل رونویسی جریانی جدید است که برای تبدیل گفتار به متن با تأخیر بسیار کم ساخته شده است. این مدل هم‌زمان با صحبت‌کردن افراد، صدا را رونویسی می‌کند، بنابراین محصولات زنده می‌توانند سریع‌تر، پاسخ‌گوتر و طبیعی‌تر احساس شوند؛ از زیرنویس‌هایی که در لحظه ظاهر می‌شوند تا یادداشت‌های جلسات که همگام با مکالمه پیش می‌روند.

این مدل، گفتار زنده را هم‌زمان با وقوع در داخل گردش‌کارهای سازمانی قابل‌استفاده می‌کند. تیم‌ها می‌توانند زیرنویس‌های جلسات، کلاس‌های درس، پخش‌های رسانه‌ای و رویدادها را تولید کنند؛ یادداشت‌ها و خلاصه‌ها را درحالی‌که مکالمات هنوز در جریان هستند تولید کنند؛ عامل‌های صوتی بسازند که باید به طور مداوم کاربران را درک کنند و گردش‌کارهای پیگیری سریع‌تری را برای پشتیبانی مشتری، مراقبت‌های بهداشتی، فروش، استخدام و سایر تعاملات گفتاری با حجم بالا ایجاد کنند.

ایمنی

رابط کاربری Realtime API شامل لایه‌های متعددی از نرده‌های محافظ و کاهش‌دهنده‌های ریسک برای کمک به جلوگیری از سوءاستفاده است. OpenAI طبقه‌بندی‌کننده‌های فعال را روی جلسات Realtime API به کار می‌گیرد، به این معنی که اگر مکالمات خاصی به‌عنوان نقض‌کننده دستورالعمل‌های محتوای مضر شناسایی شوند، می‌توانند متوقف شوند. توسعه‌دهندگان همچنین می‌توانند با استفاده از کیت توسعه نرم‌افزار عامل‌ها (Agents SDK)، به‌راحتی نرده‌های محافظ ایمنی اضافی خود را اضافه کنند.

قیمت‌گذاری و دسترسی

مدل‌های GPT Realtime 2، GPT Realtime Translate و GPT Realtime Whisper در Realtime API در دسترس هستند. قیمت‌گذاری GPT Realtime 2 به‌صورت ۳۲ دلار به‌ازای هر ۱ میلیون توکن صوتی ورودی و ۶۴ دلار به‌ازای هر ۱ میلیون توکن صوتی خروجی است (۴۰ سنت به‌ازای توکن‌های ورودی کش‌شده). قیمت‌گذاری GPT Realtime Translate برابر با ۳.۴ سنت بر دقیقه و GPT Realtime Whisper نیز ۱.۷ سنت بر دقیقه تعیین شده است.

شروع کار

می‌توانید مدل‌های صوتی بلادرنگ جدید را در بستر آزمایشی (Playground) تست کنید. برای توسعه نیز می‌توانید این پرامپت را در Codex باز کنید تا GPT Realtime 2 را به یک برنامه موجود اضافه کنید یا یک برنامه جدید بسازید.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]