GPT Live
GPT Live، نسل جدید مدلهای صوتی برای تعامل طبیعی میان انسان و هوش مصنوعی
OpenAI از GPT Live رونمایی کرد؛ نسل جدیدی از مدلهای صوتی که گفتوگو با هوش مصنوعی را بیش از هر زمان دیگری به یک مکالمه واقعی میان انسانها نزدیک میکند.
GPT Live بر پایه معماری دوطرفه همزمان (Full-Duplex) ساخته شده است؛ به این معنا که میتواند همزمان به صحبتهای کاربر گوش دهد و پاسخ بدهد. در طول مکالمه، GPT Live میتواند با عباراتی مانند «هوم» یا «بله» نشان دهد که به صحبتهای شما توجه میکند، وارد گفتوگوهای سریع و رفتوبرگشتی شود یا هر زمان که برای فکرکردن به سکوت نیاز داشته باشید، بدون ایجاد وقفه منتظر بماند. نتیجه، تجربهای صوتی است که صحبتکردن با آن به شکلی محسوس روانتر و طبیعیتر احساس میشود.
همگام و پیشگام
به گفته OpenAI، مدل GPT Live هوشمندترین مدل صوتیای است که تاکنون توسعه داده. هنگامی که پرسشی به جستوجوی وب، استدلال عمیقتر یا انجام وظایف پیچیدهتر نیاز داشته باشد، این مدل در پسزمینه انجام کار را به جدیدترین مدل مرزی واگذار میکند و پس از آمادهشدن نتیجه، آن را به جریان مکالمه بازمیگرداند. در تمام این مدت، GPT Live میتواند به گفتوگو ادامه دهد و پیوستگی مکالمه را حفظ کند. در زمان عرضه، GPT Live از GPT 5.5 بهعنوان مدل پشتیبان استفاده میکند و با عرضه نسلهای جدید مدلهای مرزی، مدل مورداستفاده در GPT Live نیز به طور مستمر بهروزرسانی خواهد شد.
این پیشرفتها تجربه جدیدی از ChatGPT Voice را فراهم میکنند که هم هوشمندتر است و هم استفاده از آن طبیعیتر احساس میشود. OpenAI معتقد است در بلندمدت این پژوهش مسیر استفاده از تعامل صوتی برای انجام وظایف پیچیدهتر، طولانیتر و عاملیتمحورتر را نیز هموار خواهد کرد.
عرضه تدریجی دو نسخه GPT Live 1 و GPT Live 1 mini برای کاربران ChatGPT در سراسر جهان آغاز شده و بهزودی از طریق API نیز در اختیار توسعهدهندگان قرار خواهد گرفت.
ورود به عصر جدید تعامل انسان و هوش مصنوعی
OpenAI چشمانداز خود را فراهمکردن تعاملی کاملاً طبیعی میان انسان و هوش مصنوعی معرفی میکند؛ جهانی که در آن همکاری با هوش مصنوعی به همان اندازه روان، پاسخگو و طبیعی باشد که همکاری با یک انسان است؛ درحالیکه فرایند استدلال و اجرای وظایف پیچیده بهصورت یکپارچه در پسزمینه انجام شود.
رویکردهای پیشین
نسلهای قبلی سامانههای صوتی هوش مصنوعی، OpenAI را به این چشمانداز نزدیکتر کردند، اما با محدودیتهای مهمی همراه بودند.
سامانههای صوتی آبشاری یا زنجیرهای (Cascaded Voice Systems)
سامانههای صوتی زنجیرهای برای پردازش هر نوبت از مکالمه به مجموعهای از مدلها متکی هستند که بهترتیب و پشتسرهم اجرا میشوند. نسخه اولیه ChatGPT Voice سه مدل را به یکدیگر متصل میکرد:
- یک مدل تبدیل گفتار به متن (Speech-to-Text) برای رونویسی صحبتهای کاربر،
- یک مدل زبانی بزرگ (LLM) برای تولید پاسخ،
- و یک مدل تبدیل متن به گفتار (Text-to-Speech) برای تبدیل پاسخ متنی به صوت.
این معماری برای نخستینبار امکان گفتوگو با مدلهای مرزی هوش مصنوعی را فراهم کرد، اما این پیچیدگی هزینههایی نیز به همراه داشت؛ بخشی از اطلاعات ممکن بود هنگام انتقال میان مدلها از دست برود و پاسخها نیز اغلب با تأخیر و لحنی ناهماهنگ ارائه میشدند.
مدلهای صوتی مبتنی بر نوبت (Turn-based Voice Models)
مدلهای صوتی مبتنی بر نوبت، مانند ChatGPT Advanced Voice Mode، پردازش و تولید صدا را درون یک مدل واحد انجام میدادند. این رویکرد باعث کاهش تأخیر و روانتر شدن مکالمه میشد، اما همچنان بر مبنای نوبتهای مجزا عمل میکرد. مدل ناچار بود تا پایان صحبت کاربر منتظر بماند و سپس پاسخ دهد؛ موضوعی که باعث میشد گفتوگو ساختاری خشک و رفتوبرگشتی پیدا کند.
علاوه بر این، ازآنجاییکه تشخیص پایان نوبت صحبت بر اساس سکوت انجام میشد، حتی یک مکث کوتاه یا صدای پسزمینه نیز میتوانست بهاشتباه پایان صحبت کاربر تلقی شود و مدل را وادار کند در زمانهای نامناسب صحبت او را قطع کند.
رویکرد جدید
GPT Live این محدودیتها را با دو تغییر بنیادی در معماری خود برطرف میکند.
تعامل پیوسته
OpenAI در گام نخست، GPT Live را برای تعامل پیوسته و بر پایه معماری Full-Duplex طراحی کرد. برخلاف مدلهایی که دنبالهای از پیامهای جداگانه را پردازش میکنند، GPT Live به طور مداوم ورودی را پردازش میکند و همزمان خروجی تولید میکند. در نتیجه، این مدل میتواند چندین بار در هر ثانیه درباره نحوه تعامل تصمیم بگیرد؛ اینکه آیا صحبت کند، همچنان گوش دهد، مکث کند، صحبت کاربر را قطع کند یا از یک ابزار استفاده کند. این قابلیت امکان گفتوگوهای طبیعیتر، درک بهتر از زمان و حتی انجام ترجمه همزمان را فراهم میکند.
واگذاری وظایف برای انجام کارهای عمیقتر
در مرحله دوم، وظیفه تعامل پیوسته از انجام پردازشهای عمیقتر جدا شد. هر زمان پرسشی به جستوجو، استدلال یا قابلیتهای عاملیتمحور بیشتری نیاز داشته باشد، GPT Live میتواند انجام آن را به مدلی دیگر مانند GPT 5.5، واگذار کند. بهاینترتیب، حتی درحالیکه چندین وظیفه در پسزمینه در حال اجرا هستند، GPT Live میتواند مکالمه را بدون وقفه ادامه دهد. این تغییر معماری همچنین امکان استفاده مداوم GPT Live از جدیدترین مدلها و عاملهای هوش مصنوعی را فراهم میکند و هوش مدلهای مرزی را با تجربهای طبیعی از تعامل ترکیب میسازد.
بنچمارکها
برای سنجش میزان رضایت تجربه کاربری و روان بودن جریان مکالمه، OpenAI مجموعهای از بنچمارکهای جدید مبتنی بر ارزیابی و داوری انسان طراحی کرده است. در این مقایسههای رودررو، GPT Live 1 و GPT Live 1 mini در مکالمات همسطح ۵ تا ۱۰ دقیقهای، از نظر ترجیح کلی کاربران، نوبتگیری در مکالمه، میزان قطعکردن صحبت، روان بودن گفتوگو و طبیعی بودن تعامل، به طور قابلتوجهی نسبت به Advanced Voice Mode ترجیح داده شدند.


- GPQA: مدل GPT Live 1 عملکردی بهمراتب بهتر از Advanced Voice Mode در آزمون GPQA دارد؛ آزمونی که توانایی استدلال علمی در سطح متخصص را در حوزههای زیستشناسی، شیمی و فیزیک میسنجد.
- BrowseComp: مدل GPT Live 1 در آزمون BrowseComp نیز پیشرفت چشمگیری نسبت به Advanced Voice Mode نشان میدهد. این آزمون توانایی جستوجوی عاملمحور در وب و یافتن اطلاعات دشوار را ارزیابی میکند.
- τ³-Voice Telecom (نسخه داخلی): GPT Live 1 در معیار τ³-Voice Telecom نیز عملکرد بهتری نسبت به Advanced Voice Mode دارد. این آزمون، عاملهای صوتی را در سناریوهای واقعی و چندمرحلهای پشتیبانی مشتریان در صنعت مخابرات ارزیابی میکند.



** در این ارزیابی از یک مدل کاربری سفارشیسازیشده، مبتنی بر جدیدترین مدلهای استدلالی خود، استفاده کردهایم.
تجربه جدید ChatGPT Voice
به ادعای OpenAI، هر هفته بیش از ۱۵۰ میلیون نفر از طریق قابلیتهایی مانند Voice و Dictation با ChatGPT صحبت میکنند. کاربران از این قابلیتها برای کارهای روزمره، تمرین زبان، تعریف داستان قبل از خواب یا صرفاً گفتوگو در مسیر رفتوآمد استفاده میکنند.
مکالمات طبیعیتر
اکنون گفتوگو با ChatGPT بیش از گذشته شبیه یک مکالمه واقعی است. میتوانید هنگام پاسخدادن سؤال جدیدی مطرح کنید، برای جمعبندی افکار خود مکث کنید یا از ChatGPT بخواهید آهستهتر صحبت کند. همچنین این مدل به طور طبیعی با عباراتی مانند «هوم» یا «متوجه شدم» نشان میدهد که صحبتهای شما را دنبال میکند. علاوه بر این، ۹ صدای متمایز ChatGPT نیز برای استفاده در GPT Live بازطراحی و بازتولید شدهاند.
پاسخهای هوشمندتر
اکنون ChatGPT Voice میتواند از جدیدترین مدلهای مرزی OpenAI استفاده کند و در مواقع لازم پاسخهای هوشمندانهتری ارائه دهد. همچنین میتوانید سطح استدلال موردنیاز خود را انتخاب کنید:
- Instant برای پاسخهای سریع؛
- Medium و High زمانی که میخواهید ChatGPT زمان بیشتری را صرف فکرکردن کند.
شنیدن بهتر
اگر برای فکرکردن مکث کنید، ChatGPT Voice اکنون منتظر میماند و صحبت شما را قطع نمیکند. اگر نیز از آن بخواهید فقط گوش دهد و سکوت کند، همین کار را انجام خواهد داد. همچنین در محیطهای شلوغ، مانند هنگام عبور خودروها یا وجود مکالمات اطراف، ChatGPT بهتر میتواند بر صدای شما تمرکز کند و کمتر تحتتأثیر نویز محیط قرار گیرد.
پاسخهای بصری در یک نگاه
برخی پاسخها زمانی مفیدتر هستند که بتوان آنها را مشاهده کرد. اکنون هنگام گفتوگوی صوتی، ChatGPT میتواند برای موضوعاتی مانند وضعیت آبوهوا، سهام، مسابقات ورزشی و موارد دیگر، کارتهای بصری نمایش دهد. قابلیت Voice همچنان از جستوجو، حافظه، تصاویر و بارگذاری فایل نیز پشتیبانی میکند.

ایمنی طراحیشده برای تعامل صوتی
GPT Live از ابتدا با رویکرد ایمنی پیشفرض (Safe by Default) طراحی شده است. این مدل ضمن بهرهگیری از پیشرفتهای ایمنی نسل جدید مدلهای OpenAI، آموزشهای اختصاصی در حوزههای پرریسک و مجموعهای از سازوکارهای حفاظتی ویژه تعامل صوتی را نیز در خود جای داده است.
گسترش آزمونهای ایمنی
برایآنکه ارزیابیهای ایمنی بهتر بتوانند بازتابدهنده نحوه استفاده واقعی کاربران از قابلیت صوتی باشند، دامنه آزمونهای ایمنی با افزودن ارزیابیهای صوتی بومی (Audio-native) گسترش داده شدهاند. همچنین OpenAI مجموعهای از ارزیابیهای مصنوعی مبتنی بر صدای تولیدشده ایجاد کرده تا با تمرکز بیشتری حوزههای حساس ایمنی را بررسی کند؛ حوزههایی که بر اساس تجربه حاصل از Advanced Voice Mode انتخاب شدهاند.
این حوزهها شامل موارد زیر هستند:
- آسیب به خود،
- روانپریشی،
- وابستگی عاطفی به هوش مصنوعی،
- خشونت،
- محتوای جنسی.
علاوه بر این، متخصصان داخلی OpenAI نیز با اجرای آزمونهای تیم قرمز (Red Teaming)، مخاطرات منحصربهفرد تعامل صوتی را بررسی کردند. نتایج آزمونها نشان داد GPT Live در تقریباً تمام حوزههای مورد ارزیابی عملکردی همسطح یا بهتر از Advanced Voice Mode دارد.
سازوکارهای حفاظتی داخلی
ازآنجاکه مکالمات صوتی بهصورت لحظهای انجام میشوند، سازوکارهای حفاظتی نیز بهگونهای طراحی شدهاند که هنگام صحبتکردن مدل فعال باشند. اگر سامانه، خروجی ناایمن را تشخیص دهد میتواند مدل را به سمت پاسخ ایمنتر هدایت کند، پیامها یا منابع ایمنی بیشتری در اختیار کاربر قرار دهد یا در موارد پرخطر، مکالمه صوتی را پایان دهد.
در گفتوگوهای مرتبط با خودآسیبرسانی نیز جریانهای حمایتی ChatGPT برای تعامل صوتی سازگار شدهاند؛ از جمله ارائه اطلاعات مربوط به خطوط تلفنی کمکرسانی بحران که توسط متخصصان تأیید شدهاند. همچنین برای کاربران نوجوان، لایههای حفاظتی بیشتری طراحی شده و رفتار متناسب با سن مستقیماً در مدل آموزشدادهشده است تا احتمال ارائه پاسخهای نامناسب کاهش یابد.
والدین نیز از طریق قابلیت Parental Controls میتوانند تعیین کنند که آیا فرزند نوجوان آنها به ChatGPT Voice دسترسی داشته باشد یا خیر. همچنین در شرایط پرخطر که نشانههایی از خودآسیبرسانی یا افکار خودکشی مشاهده شود، والدین متصل به حساب کاربری ممکن است مطلع شوند.
یادگیری از استفاده در دنیای واقعی
همچنین OpenAI سامانهای برای پایش بلندمدت و نظارت پس از عرضه، با تمرکز بر موضوع وابستگی عاطفی، راهاندازی کرده تا درک خود از این پدیده را افزایش دهد و سازوکارهای حفاظتی را بهبود دهد. این اقدام بر پایه پژوهشهای پیشین OpenAI درباره استفاده عاطفی از هوش مصنوعی و رفاه روانی انجام شده و به OpenAI کمک میکند الگوهای نوظهور را شناسایی کند و نحوه پاسخگویی سیستم در تعاملات حساس از نظر عاطفی را بهبود دهد.
در نهایت، GPT Live برای گفتوگو طراحی شده است، نه جعل یا تقلید صدای افراد. این مدل تنها از مجموعهای از صداهای از پیش تعریفشده ChatGPT استفاده میکند و به سازوکارهای حفاظتی مجهز است که از تقلید صدای افراد واقعی جلوگیری میکنند.
دسترسی و محدودیتها
عرضه GPT Live از هماکنون برای کاربران ChatGPT در سراسر جهان و روی اپهای iOS، Android و نسخه وب ChatGPT آغاز شده است. مدل GPT Live 1 به مدل پیشفرض ChatGPT Voice برای کاربران Go، Plus و Pro تبدیل خواهد شد و GPT Live 1 mini نیز مدل پیشفرض کاربران نسخه Free خواهد بود.
GPT Live برای برخی از پرکاربردترین زبانهای ChatGPT بهینهسازی شده است. بااینحال، در بعضی زبانها ممکن است مدل با لهجهای غیربومی صحبت کند یا در روانی گفتار محدودیتهایی داشته باشد.
