Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
جیتکس ترکیه
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 GPT Live، نسل جدید مدل‌های صوتی برای تعامل طبیعی میان انسان و هوش مصنوعی

GPT Live

GPT Live، نسل جدید مدل‌های صوتی برای تعامل طبیعی میان انسان و هوش مصنوعی

زمان مطالعه: 7 دقیقه

 OpenAI از GPT Live رونمایی کرد؛ نسل جدیدی از مدل‌های صوتی که گفت‌وگو با هوش مصنوعی را بیش از هر زمان دیگری به یک مکالمه واقعی میان انسان‌ها نزدیک می‌کند.

GPT Live بر پایه معماری دوطرفه هم‌زمان (Full-Duplex) ساخته شده است؛ به این معنا که می‌تواند هم‌زمان به صحبت‌های کاربر گوش دهد و پاسخ بدهد. در طول مکالمه، GPT Live می‌تواند با عباراتی مانند «هوم» یا «بله» نشان دهد که به صحبت‌های شما توجه می‌کند، وارد گفت‌وگوهای سریع و رفت‌وبرگشتی شود یا هر زمان که برای فکرکردن به سکوت نیاز داشته باشید، بدون ایجاد وقفه منتظر بماند. نتیجه، تجربه‌ای صوتی است که صحبت‌کردن با آن به شکلی محسوس روان‌تر و طبیعی‌تر احساس می‌شود.

همگام و پیشگام

به گفته OpenAI، مدل GPT Live هوشمندترین مدل صوتی‌ای است که تاکنون توسعه داده. هنگامی که پرسشی به جست‌وجوی وب، استدلال عمیق‌تر یا انجام وظایف پیچیده‌تر نیاز داشته باشد، این مدل در پس‌زمینه انجام کار را به جدیدترین مدل مرزی واگذار می‌کند و پس از آماده‌شدن نتیجه، آن را به جریان مکالمه بازمی‌گرداند. در تمام این مدت، GPT Live می‌تواند به گفت‌وگو ادامه دهد و پیوستگی مکالمه را حفظ کند. در زمان عرضه، GPT Live از GPT 5.5 به‌عنوان مدل پشتیبان استفاده می‌کند و با عرضه نسل‌های جدید مدل‌های مرزی، مدل مورداستفاده در GPT Live نیز به طور مستمر به‌روزرسانی خواهد شد.

این پیشرفت‌ها تجربه جدیدی از ChatGPT Voice را فراهم می‌کنند که هم هوشمندتر است و هم استفاده از آن طبیعی‌تر احساس می‌شود. OpenAI معتقد است در بلندمدت این پژوهش مسیر استفاده از تعامل صوتی برای انجام وظایف پیچیده‌تر، طولانی‌تر و عاملیت‌محورتر را نیز هموار خواهد کرد.

عرضه تدریجی دو نسخه GPT Live 1 و GPT Live 1 mini برای کاربران ChatGPT در سراسر جهان آغاز شده و به‌زودی از طریق API نیز در اختیار توسعه‌دهندگان قرار خواهد گرفت.

ورود به عصر جدید تعامل انسان و هوش مصنوعی

OpenAI چشم‌انداز خود را فراهم‌کردن تعاملی کاملاً طبیعی میان انسان و هوش مصنوعی معرفی می‌کند؛ جهانی که در آن همکاری با هوش مصنوعی به همان اندازه روان، پاسخ‌گو و طبیعی باشد که همکاری با یک انسان است؛ درحالی‌که فرایند استدلال و اجرای وظایف پیچیده به‌صورت یکپارچه در پس‌زمینه انجام شود.

رویکردهای پیشین

نسل‌های قبلی سامانه‌های صوتی هوش مصنوعی، OpenAI را به این چشم‌انداز نزدیک‌تر کردند، اما با محدودیت‌های مهمی همراه بودند.

سامانه‌های صوتی آبشاری یا زنجیره‌ای (Cascaded Voice Systems)

سامانه‌های صوتی زنجیره‌ای برای پردازش هر نوبت از مکالمه به مجموعه‌ای از مدل‌ها متکی هستند که به‌ترتیب و پشت‌سرهم اجرا می‌شوند. نسخه اولیه ChatGPT Voice سه مدل را به یکدیگر متصل می‌کرد:

  • یک مدل تبدیل گفتار به متن (Speech-to-Text) برای رونویسی صحبت‌های کاربر،
  • یک مدل زبانی بزرگ (LLM) برای تولید پاسخ،
  • و یک مدل تبدیل متن به گفتار (Text-to-Speech) برای تبدیل پاسخ متنی به صوت.

این معماری برای نخستین‌بار امکان گفت‌وگو با مدل‌های مرزی هوش مصنوعی را فراهم کرد، اما این پیچیدگی هزینه‌هایی نیز به همراه داشت؛ بخشی از اطلاعات ممکن بود هنگام انتقال میان مدل‌ها از دست برود و پاسخ‌ها نیز اغلب با تأخیر و لحنی ناهماهنگ ارائه می‌شدند.

مدل‌های صوتی مبتنی بر نوبت (Turn-based Voice Models)

مدل‌های صوتی مبتنی بر نوبت، مانند ChatGPT Advanced Voice Mode، پردازش و تولید صدا را درون یک مدل واحد انجام می‌دادند. این رویکرد باعث کاهش تأخیر و روان‌تر شدن مکالمه می‌شد، اما همچنان بر مبنای نوبت‌های مجزا عمل می‌کرد. مدل ناچار بود تا پایان صحبت کاربر منتظر بماند و سپس پاسخ دهد؛ موضوعی که باعث می‌شد گفت‌وگو ساختاری خشک و رفت‌وبرگشتی پیدا کند.

علاوه بر این، ازآنجایی‌که تشخیص پایان نوبت صحبت بر اساس سکوت انجام می‌شد، حتی یک مکث کوتاه یا صدای پس‌زمینه نیز می‌توانست به‌اشتباه پایان صحبت کاربر تلقی شود و مدل را وادار کند در زمان‌های نامناسب صحبت او را قطع کند.

رویکرد جدید

GPT Live این محدودیت‌ها را با دو تغییر بنیادی در معماری خود برطرف می‌کند.

تعامل پیوسته

OpenAI در گام نخست، GPT Live را برای تعامل پیوسته و بر پایه معماری Full-Duplex طراحی کرد. برخلاف مدل‌هایی که دنباله‌ای از پیام‌های جداگانه را پردازش می‌کنند، GPT Live به طور مداوم ورودی را پردازش می‌کند و هم‌زمان خروجی تولید می‌کند. در نتیجه، این مدل می‌تواند چندین بار در هر ثانیه درباره نحوه تعامل تصمیم بگیرد؛ اینکه آیا صحبت کند، همچنان گوش دهد، مکث کند، صحبت کاربر را قطع کند یا از یک ابزار استفاده کند. این قابلیت امکان گفت‌وگوهای طبیعی‌تر، درک بهتر از زمان و حتی انجام ترجمه هم‌زمان را فراهم می‌کند.

واگذاری وظایف برای انجام کارهای عمیق‌تر

در مرحله دوم، وظیفه تعامل پیوسته از انجام پردازش‌های عمیق‌تر جدا شد. هر زمان پرسشی به جست‌وجو، استدلال یا قابلیت‌های عاملیت‌محور بیشتری نیاز داشته باشد، GPT Live می‌تواند انجام آن را به مدلی دیگر مانند GPT 5.5، واگذار کند. به‌این‌ترتیب، حتی درحالی‌که چندین وظیفه در پس‌زمینه در حال اجرا هستند، GPT Live می‌تواند مکالمه را بدون وقفه ادامه دهد. این تغییر معماری همچنین امکان استفاده مداوم GPT Live از جدیدترین مدل‌ها و عامل‌های هوش مصنوعی را فراهم می‌کند و هوش مدل‌های مرزی را با تجربه‌ای طبیعی از تعامل ترکیب می‌سازد.

بنچمارک‌ها

برای سنجش میزان رضایت تجربه کاربری و روان بودن جریان مکالمه، OpenAI مجموعه‌ای از بنچمارک‌های جدید مبتنی بر ارزیابی و داوری انسان طراحی کرده است. در این مقایسه‌های رودررو، GPT Live 1 و GPT Live 1 mini در مکالمات هم‌سطح ۵ تا ۱۰ دقیقه‌ای، از نظر ترجیح کلی کاربران، نوبت‌گیری در مکالمه، میزان قطع‌کردن صحبت، روان بودن گفت‌وگو و طبیعی بودن تعامل، به طور قابل‌توجهی نسبت به Advanced Voice Mode ترجیح داده شدند.

  • GPQA: مدل GPT Live 1 عملکردی به‌مراتب بهتر از Advanced Voice Mode در آزمون GPQA دارد؛ آزمونی که توانایی استدلال علمی در سطح متخصص را در حوزه‌های زیست‌شناسی، شیمی و فیزیک می‌سنجد.
  • BrowseComp: مدل GPT Live 1 در آزمون BrowseComp نیز پیشرفت چشمگیری نسبت به Advanced Voice Mode نشان می‌دهد. این آزمون توانایی جست‌وجوی عامل‌محور در وب و یافتن اطلاعات دشوار را ارزیابی می‌کند.
  • τ³-Voice Telecom  (نسخه داخلی): GPT Live 1 در معیار τ³-Voice Telecom نیز عملکرد بهتری نسبت به Advanced Voice Mode دارد. این آزمون، عامل‌های صوتی را در سناریوهای واقعی و چندمرحله‌ای پشتیبانی مشتریان در صنعت مخابرات ارزیابی می‌کند.

تجربه جدید ChatGPT Voice

به ادعای OpenAI، هر هفته بیش از ۱۵۰ میلیون نفر از طریق قابلیت‌هایی مانند Voice و Dictation با ChatGPT صحبت می‌کنند. کاربران از این قابلیت‌ها برای کارهای روزمره، تمرین زبان، تعریف داستان قبل از خواب یا صرفاً گفت‌وگو در مسیر رفت‌وآمد استفاده می‌کنند.

مکالمات طبیعی‌تر

اکنون گفت‌وگو با ChatGPT بیش از گذشته شبیه یک مکالمه واقعی است. می‌توانید هنگام پاسخ‌دادن سؤال جدیدی مطرح کنید، برای جمع‌بندی افکار خود مکث کنید یا از ChatGPT بخواهید آهسته‌تر صحبت کند. همچنین این مدل به طور طبیعی با عباراتی مانند «هوم» یا «متوجه شدم» نشان می‌دهد که صحبت‌های شما را دنبال می‌کند. علاوه بر این، ۹ صدای متمایز ChatGPT نیز برای استفاده در GPT Live بازطراحی و بازتولید شده‌اند.

پاسخ‌های هوشمندتر

اکنون ChatGPT Voice می‌تواند از جدیدترین مدل‌های مرزی OpenAI استفاده کند و در مواقع لازم پاسخ‌های هوشمندانه‌تری ارائه دهد. همچنین می‌توانید سطح استدلال موردنیاز خود را انتخاب کنید:

  • Instant برای پاسخ‌های سریع؛
  • Medium و High زمانی که می‌خواهید ChatGPT زمان بیشتری را صرف فکرکردن کند.

شنیدن بهتر

اگر برای فکرکردن مکث کنید، ChatGPT Voice اکنون منتظر می‌ماند و صحبت شما را قطع نمی‌کند. اگر نیز از آن بخواهید فقط گوش دهد و سکوت کند، همین کار را انجام خواهد داد. همچنین در محیط‌های شلوغ، مانند هنگام عبور خودروها یا وجود مکالمات اطراف، ChatGPT بهتر می‌تواند بر صدای شما تمرکز کند و کمتر تحت‌تأثیر نویز محیط قرار گیرد.

پاسخ‌های بصری در یک نگاه

برخی پاسخ‌ها زمانی مفیدتر هستند که بتوان آن‌ها را مشاهده کرد. اکنون هنگام گفت‌وگوی صوتی، ChatGPT می‌تواند برای موضوعاتی مانند وضعیت آب‌وهوا، سهام، مسابقات ورزشی و موارد دیگر، کارت‌های بصری نمایش دهد. قابلیت Voice همچنان از جست‌وجو، حافظه، تصاویر و بارگذاری فایل نیز پشتیبانی می‌کند.

ایمنی طراحی‌شده برای تعامل صوتی

GPT Live از ابتدا با رویکرد ایمنی پیش‌فرض (Safe by Default) طراحی شده است. این مدل ضمن بهره‌گیری از پیشرفت‌های ایمنی نسل جدید مدل‌های OpenAI، آموزش‌های اختصاصی در حوزه‌های پرریسک و مجموعه‌ای از سازوکارهای حفاظتی ویژه تعامل صوتی را نیز در خود جای داده است.

گسترش آزمون‌های ایمنی

برای‌آنکه ارزیابی‌های ایمنی بهتر بتوانند بازتاب‌دهنده نحوه استفاده واقعی کاربران از قابلیت صوتی باشند، دامنه آزمون‌های ایمنی با افزودن ارزیابی‌های صوتی بومی (Audio-native) گسترش داده شده‌اند. همچنین OpenAI مجموعه‌ای از ارزیابی‌های مصنوعی مبتنی بر صدای تولیدشده ایجاد کرده تا با تمرکز بیشتری حوزه‌های حساس ایمنی را بررسی کند؛ حوزه‌هایی که بر اساس تجربه حاصل از Advanced Voice Mode انتخاب شده‌اند.

این حوزه‌ها شامل موارد زیر هستند:

  • آسیب به خود،
  • روان‌پریشی،
  • وابستگی عاطفی به هوش مصنوعی،
  • خشونت،
  • محتوای جنسی.

علاوه بر این، متخصصان داخلی OpenAI نیز با اجرای آزمون‌های تیم قرمز (Red Teaming)، مخاطرات منحصربه‌فرد تعامل صوتی را بررسی کردند. نتایج آزمون‌ها نشان داد GPT Live در تقریباً تمام حوزه‌های مورد ارزیابی عملکردی هم‌سطح یا بهتر از Advanced Voice Mode دارد.

سازوکارهای حفاظتی داخلی

ازآنجاکه مکالمات صوتی به‌صورت لحظه‌ای انجام می‌شوند، سازوکارهای حفاظتی نیز به‌گونه‌ای طراحی شده‌اند که هنگام صحبت‌کردن مدل فعال باشند. اگر سامانه، خروجی ناایمن را تشخیص دهد می‌تواند مدل را به سمت پاسخ ایمن‌تر هدایت کند، پیام‌ها یا منابع ایمنی بیشتری در اختیار کاربر قرار دهد یا در موارد پرخطر، مکالمه صوتی را پایان دهد.

در گفت‌وگوهای مرتبط با خودآسیب‌رسانی نیز جریان‌های حمایتی ChatGPT برای تعامل صوتی سازگار شده‌اند؛ از جمله ارائه اطلاعات مربوط به خطوط تلفنی کمک‌رسانی بحران که توسط متخصصان تأیید شده‌اند. همچنین برای کاربران نوجوان، لایه‌های حفاظتی بیشتری طراحی شده و رفتار متناسب با سن مستقیماً در مدل آموزش‌داده‌شده است تا احتمال ارائه پاسخ‌های نامناسب کاهش یابد.

والدین نیز از طریق قابلیت Parental Controls می‌توانند تعیین کنند که آیا فرزند نوجوان آن‌ها به ChatGPT Voice دسترسی داشته باشد یا خیر. همچنین در شرایط پرخطر که نشانه‌هایی از خودآسیب‌رسانی یا افکار خودکشی مشاهده شود، والدین متصل به حساب کاربری ممکن است مطلع شوند.

یادگیری از استفاده در دنیای واقعی

همچنین OpenAI سامانه‌ای برای پایش بلندمدت و نظارت پس از عرضه، با تمرکز بر موضوع وابستگی عاطفی، راه‌اندازی کرده تا درک خود از این پدیده را افزایش دهد و سازوکارهای حفاظتی را بهبود دهد. این اقدام بر پایه پژوهش‌های پیشین OpenAI درباره استفاده عاطفی از هوش مصنوعی و رفاه روانی انجام شده و به OpenAI کمک می‌کند الگوهای نوظهور را شناسایی کند و نحوه پاسخ‌گویی سیستم در تعاملات حساس از نظر عاطفی را بهبود دهد.

در نهایت، GPT Live برای گفت‌وگو طراحی شده است، نه جعل یا تقلید صدای افراد. این مدل تنها از مجموعه‌ای از صداهای از پیش تعریف‌شده ChatGPT استفاده می‌کند و به سازوکارهای حفاظتی مجهز است که از تقلید صدای افراد واقعی جلوگیری می‌کنند.

دسترسی و محدودیت‌ها

عرضه GPT Live از هم‌اکنون برای کاربران ChatGPT در سراسر جهان و روی اپ‌های iOS، Android و نسخه وب ChatGPT آغاز شده است. مدل GPT Live 1 به مدل پیش‌فرض ChatGPT Voice برای کاربران Go، Plus و Pro تبدیل خواهد شد و GPT Live 1 mini نیز مدل پیش‌فرض کاربران نسخه Free خواهد بود.

GPT Live برای برخی از پرکاربردترین زبان‌های ChatGPT بهینه‌سازی شده است. بااین‌حال، در بعضی زبان‌ها ممکن است مدل با لهجه‌ای غیربومی صحبت کند یا در روانی گفتار محدودیت‌هایی داشته باشد.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]