
هر چتبات سبک نویسندگی خاص خود را دارد؛ درست مانند انسانها
آخرین باری که با ChatGPT تعامل کردید؛ حس کردید با یک نفر در حال گپزدن هستید یا انگار با چند شخص مختلف صحبت میکنید؟
پردازش گفتار که به ماشینها قابلیت درک و پردازش گفتار انسانها را میدهد، یکی از فناوریهای اصلی هوش مصنوعی میباشد که امروزه بسیار مورد توجه قرار گرفته است. این فناوری با تمرکز بر ایجاد ارتباط کلامی بین ماشینها و انسانها منجر به تبدیل هر چه بیشتر دنیای واقعی به فیلمهای علمی-تخیلی شده است. چیستی این فناوری، تاریخچه، نحوه کار و ارزیابی سیستمهای پردازش گفتار و تفاوتش با پردازش صدا از جمله مواردی است که میتواند به شناخت این حوزه فناوری کمک نماید، درباره پردازش گفتار بیشتر بخوانید

آخرین باری که با ChatGPT تعامل کردید؛ حس کردید با یک نفر در حال گپزدن هستید یا انگار با چند شخص مختلف صحبت میکنید؟

اگر به دنبال درک عمیقتری از هوش مصنوعی مولد، رباتیک، تراشهها و فناوریهای مرتبط هستید، این فرصت طلایی را از دست ندهید.

در نگاه اول، شاید به نظر برسد هر کسی میتواند با چند دستور ساده از ChatGPT یا مدلهای مشابه، پاسخ بگیرد؛ اما تفاوت زمانی آشکار میشود که خروجی دقیق، کارآمد و سفارشی لازم باشد.

چتباتهای مبتنی بر هوش مصنوعی طی چند سال اخیر با سرعتی بیسابقه در زندگی روزمره و کسبوکارها نفوذ کردهاند. با توجه به این رشد انفجاری و نقش فزاینده، در این مقاله به بررسی تطبیقی چتباتهای شناختهشده پرداخته و چشمانداز جهانی و داخلی آنها را تحلیل خواهیم کرد.

مدلهای بنیادی، با وجود تحول بزرگی که ایجاد کردهاند، خالی از ضعف نیستند. شناخت این محدودیتها برای استفاده درست و مسئولانه از این ابزارهای قدرتمند ضروری است. در ادامه این محدودیتها را بررسی میکنیم.

به نظر میرسد رقابت برای ساخت مدلهای زبانی بزرگ به پایان رسیده است و تنها چند برنده واضح در این رقابت باقیماندهاند.

معمولاً پاسخهای هوش مصنوعی، بهویژه در زمینههای حساس مانند بهداشت و امور مالی، توسط انسانها بایدمورد بررسی قرار گیرد.

بر اساس گزارش تازهای که توسط نسکام-زینوو (Nasscom-Zinnov) منتشر شده است، پیشبینی میشود تا پایان سال ۲۰۲۴ تعداد مراکز جهانی توانمندی (GCC) در هند به ۱۷۰۰ مرکز افزایش یابد. این مراکز با ایجاد بیش از ۱.۹ میلیون شغل، درآمد صادراتی معادل ۶۴.۶ میلیارد دلار را به همراه خواهند داشت. همچنین،

اکنون این ویژگی در نسخه بتای iOS 18.2 برای توسعهدهندگان بهصورت زودهنگام قابل دسترسی است.

به تازگی مشخص شده است که مدل هوش مصنوعی whisper با مشکلات جدی دست و پنجه نرم میکند.

مدلهای زبانی در هوش مصنوعی تحولات بزرگی را در چند سال اخیر تجربه کردهاند و به طرز چشمگیری دنیای هوش مصنوعی را متحول کردهاند. این مدلها که بهمنظور درک و تولید و پردازش زبان انسان طراحی شدهاند، روزبهروز در کاربردهایی نظیر پردازش زبان طبیعی، ترجمۀ ماشینی و حتی نوشتن خلاقانه مهارت و تنوع بیشتری پیدا میکنند. این مقاله به بررسی تکامل مدلهای زبانی در هوش مصنوعی، از روزهای اولیه تا قابلیتهای پیشرفته امروزی، میپردازد.

رقابت غولهای تکنولوژی جهان بر سر دستیابی به نافذترین دستیارهای صوتی، در دوره حاضر شدت قابلتوجهی یافته است. به نحوی که در کنار آمازون، سایر شرکتها نظیر گوگل، مایکروسافت و اَپل نیز برای طراحی بهترین دستیارهای صوتی میکوشند. این موضوع علاوه بر تولید ارزش افزوده، توانسته است سرعت رشد و

برای اینکه درک بهتری از اهمیت دسته بندی صداها داشته باشید، به این مثال توجه کنید. اتاق کنفرانسی را در نظر بگیرید که یک جلسه در آن درحال برگزاری است. در این اتاق آدمهای زیادی هستند که به نوبت صحبت خواهند کرد. ما میخواهیم در این جلسه هر چه آنها

دستیار گوگل، سیری (Siri)، الکسا (Alexa) و سایر دستیارهای صوتی همیشه مایه تعجب و شگفتی من بودهاند. این دستیارها با انجام خودکار برخی کارها کمک زیادی به کاربران خود میکنند. به همین دلیل، تصمیم گرفتم برای خودم یک دستیار صوتی بسازم که دستورات صوتی را از طریق میکروفن لپتاپم دریافت

انسانها به صورت پیچیده و به طرق مختلف احساسات و عواطف خود را ابراز میکنند. برای مثال، فردی که در حال صحبت است، علاوه بر کلمات از آهنگ صوت، زیر و بمی صدا، حالات چهره و زبان بدن نیز برای انتقال پیام استفاده میکند. به همین دلیل است که جلسات

قبل از آنکه به کاربردهای شبکههای عصبی در پردازش گفتار بپردازیم، باید کارکرد اصلی گفتار را مورد بررسی قرار دهیم. به احتمال بسیار زیاد، گفتار کارآمدترین راه برای برقراری ارتباط میان انسانهاست و انسانها با کمک پردازش گفتار در ذهن، به یکدیگر پیوند میخورند. این همچنین نشانگر آن است که

فیلمهای سینمایی و برنامههای تلویزیونی دوست دارند روباتهایی را به تصویر بکشند که توانایی تشخیص گفتار و درک زبان انسان را داشته باشند و آنها را بفهمند. از جهان علمیتخیلی فیلمها تا موضوع حقیقی پردازش گفتار در پایتون این همواره آرزوی انسان بوده است. از سریالهایی مانند وستورد تا فیلمهایی

موسیقی یکی از عناصر حیاتی فیلم به شمار میرود؛ چرا که جوّ فیلم را تحت تاثیر قرار داده، به واکنشهای احساسی بینندگان جهت میدهد و بر تفسیر بینندگان از داستان و ژانر فیلم تاثیر میگذارد. پروفسور شریکانت نارایانان – سرپرست تیم تحقیقات در دانشکده مهندسی USC – مقالهای را در

یکی از ویژگیهای بارز مشاغل موفق در قرن بیست و یکم، تعامل مشتری است. طبق توضیح هاب اسپات Hubspot تعامل مشتری ایجاد تعامل با مصرف کنندگان در چندین کانال برای تقویت ارتباط شرکت با آنها است و امروزه به لطف پیشرفت در شبکه های اجتماعی، تعامل مشتری در بالاترین حد

فناوری تشخیص گفتار گوگل به عنوان گامی به سمت هوشمند شدن ابزارها به شمار میرود. یکی از قابلیتهای گوگل، قابلیت تشخیص گفتار از طریق هوش مصنوعی است. هوش مصنوعی با قابلیت پردازش زبان طبیعی در مرحله اول قادر به فهم زبان انسانی شد و توانایی برقراری ارتباط با انسان را

اصطلاح «خانه های هوشمند» از اوایل دهه شصت میلادی بر سر زبانها افتاد؛ یعنی تقریباً از زمانی که نخستین خانه های هوشمند ساخته شدند. بسیاری معتقدند اولین خانه هوشمند جهان، توسط بیل گیتس، در سال 1960 ساخته شد. انسانها بر طبق غریزه خود، همواره به دنبال تدارک سرپناه و تأمین

محققان موسسه Skoltech و همکاران آنها از Mobile TeleSystems مفهوم «پیامهای متنی نامناسب» را معرفی کرده و یک مدل عصبی با قابلیت تشخیص عبارات نامناسب را آموزش دادهاند و به همراه مجموعه بزرگی از پیامهای این چنینی منتشر کردهاند تا بتوان از آن در مطالعات آتی نیز استفاده کرد. از

میدانید چطور باید یک مدل یادگیری عمیق ساخته و آنرا ارتقا دهید؟ یا میدانید چطور باید توابع Callback سفارشی ایجاد کنید؟ توابع Callback مجموعه توابعی هستند که در مراحل خاصی از فرآیند آموزش مدل اجرا میشوند. از توابع Callback میتوان برای شناخت حالات و آمار درونی مدل طی آموزش استفاده

در هر سازمانی روزانه حجم زیادی از دادههای صوتی تولید میشوند. اگر این دادههای صوتی برای راهاندازی موتورهای هوش مصنوعی، انواع سیستم تشخیص گفتار و تجزیهوتحلیل در اختیار متخصص علم داده قرار گیرند، میتوانند اطلاعات راهبردی مهمی تولید کنند. سازمانهایی که به قدرت و اهمیت اطلاعات حاصل از دادههای صوتی

درب کاپوت اتومبیلهای مدرن را که باز میکنید، به جای مجموعهای از قطعات مکانیکی و متحرک روغنی، چیزی شبیه به کامپیوتری بزرگ و سیاه میبینید. تکامل خودرو وارد عصر جدیدی شده است. اتومبیل ساده شما دارد، به دستگاهی هوشمند تبدیل میشود که مانند دیگر وسایل هوشمند، فناوری تشخیص گفتار جزء

دستیار صوتی سیری امروزه نظر بسیاری از کاربران را به خود جلب کرده است. این ترفندها سبب شده است تا کاربران محصولات اپل بتوانند رابط کاربری جذابی را تجربه کنند. در حال حاضر شرکتهای بسیاری از دستیارهای صوتی برای تقویت تجربه کاربران استفاده میکنند که در این میان شرکت اپل

پیوتر زلاسکو، مهندس مرکز پردازش زبان و گفتار جانز هاپکینز، مدل یادگیری ماشینی را تولید کرده است که میتواند نقشهای گفتاری را در متن گفتوگوهایی که سیستمهای درک زبان (LU) پیاده کردهاند، تشخیص دهد. کامپیوترها با استفاده از این روش در نهایت میتوانند متن گفتاری یا نوشتاری را همانند انسانها

بدون شک یکی از دغدغههای مهم کسبوکارها، همگام ماندن با انتظارات مشتریان است و برای رسیدگی به آن، استفاده از هوش مصنوعی مکالمه ای یکی از بهترین گزینههاست.. مشتریان خدماتی سریعتر با قدرت پاسخگویی بهتر در همهی کانالها میخواهند و انتظار دارند امکان جابجایی راحت بین این کانالها وجود داشته

در این پروژه، ما از LSTM به جای GAN برای تولید موسیقی استفاده خواهیم کرد. در نتیجه استفاده از LSTM ها، مدل سریعتر آموزش میبیند و میتوانیم عملکرد مدل را بر مبنای یک خروجی عینی ارزیابی کنیم.

بیتردید، محصولات فناوری مارک زاکربرگ از قبیل فیسبوک یا نرمافزارهایی همچون مسنجر و واتسپ، نحوه برقراری ارتباطات را متحول کردهاند. اما اکنون پرسشی بزرگتر مطرح شده است: آیا این فناوریها برای تعامل با رباتها هم راهکاری دارند؟ درحالحاضر، برقراری ارتباط با هوش مصنوعی از طریق زبان طبیعی، جزئی از زندگی

یک دستیار شخصی مجهز به هوش مصنوعی درواقع نرمافزاری است که دستورات گفتاری و نوشتاری شما را متوجه میشود و کاری که به آن محول کردهاید را به انجام میرساند. این دستیار در حقیقت نمونهای از هوش مصنوعی ضعیف weak AI بهشمار میآید زیرا تنها خواستههای کاربر را انجام میدهد.

باز هم با یک پژوهش مشکلساز دیگر در حوزه هوش مصنوعی روبهرو هستیم. اینبار مهره مار در دانشگاهی در خاور میانه پیدا شده، جایی که در آن یک گروه از پژوهشگران از بهاصطلاح «سیستم تشخیص دروغ lie-detection system» رونمایی کردهاند. اجازه بدهید از ابتدا، روراست باشیم: هوش مصنوعی نمیتواند کاری را

در طول سالیان متمادی، تلاشهای بسیاری صورت گرفته است، تا با توسعه فناوریهای جدید گفتاری، موانع ارتباطی را برای افراد دارای اختلالات گفتاری برطرف کنند. خوشبختانه، به لطف آخرین اکتشافاتِ دانشمندان مؤسسه هندی فناوری در مَدرس، به راهحلی واقعی نزدیکتر شدهایم. درحالحاضر، فناوریِ نسبتاً محدودی، این فرصت را در اختیار

هوش مصنوعی مکالمه ای، به لطف تعدادی از نرمافزارهای مفید، زندگی را آسانتر کرده است. آنچه این نوع هوش مصنوعی را مفید و فراگیر کرده، مقدار بسیار زیادی «داده» است. انسانها، سالها با فناوری صحبت کردهاند. از سرزنش کردن تستر به خاطر سوزاندن صبحانه گرفته تا تشویق کردن ماشین هنگام

پردازش گفتار یکی از فناوریهای بنیادین هوش مصنوعی است که به ماشینها قدرت درک و پردازش گفتار انسانها را میدهد. اهمیت گفتار در برقراری ارتباط از یک سو و افزایش قدرت محاسبات سیستمهای هوشمند از سوی دیگر، رغبتی روزافزون جهت توسعه سیستمهای پردازش گفتار را ایجاد کرده است. با این

WellSaid Labs آنچه مشتریان میتوانند از هشتتا از صداپیشه های مجهز به هوش مصنوعی و دیجیتال جدید آن انتظار داشته باشند را چنین توصیف میکند: توبین «پرانرژی و خردمند است.» پِیج «خونسرد و رسا است.» و آوا «مبادی آداب، با اعتماد به نفس و حرفهای است.»

Speech Brain که یک تولکیت منبع باز مبتنی بر PyTorch است درحال حاضر مراحل ساخت را طی میکند و قرار است به زودی، نسخه آلفا برای گروهی از کاربران در طی چندماه آینده عرضه شود.

امروزه دیگر همگی به دستیاران هوشمند خانگی و سیستم پردازشگر صوتی عادت کردهایم؛ این دستگاهها میتوانند دستورات صوتی را اجرا کنند، دربارهی فعالیتهای شکبرانگیز و غیرمعمول به ما اخطار دهند، و حتی جوک بگویند. بازهی قیمت این تکنولوژی بسیار گسترده است و به همین دلیل عمدهی مردم توان خرید آن

امروزه، نرمافزارهای بازشناسی گفتار در مقیاس گستردهای به کار برده میشوند. از جمله آنها میتوان به الکسا و کورتانا اشاره کرد. گزارش شده است که در سال 2020، تقریباً دو سوم مردم آمریکا از نوعی دستیار صوتی خودکار استفاده کردهاند. این دستیارهای مجازی دیگر به هوش مصنوعی وابسته نیستند؛ آنها

در این نوشته به چگونگی تبدیل فایلهای صوتی به فایلهای متنی با استفاده از پایتون میپردازیم. این تبدیل حاصل فرایندِ تشخیص گفتار است و به طور متداول در دنیای حقیقی مورد استفاده قرار میگیرد. برای مثال، دستیارهای صوتی شخصی مثل «Home Mini» گوگل، «Alexa» آمازون و «Siri» اپل تنها چند
هوشیو رسانهای تخصصی در حوزه هوش مصنوعی است که با هدف ایجاد محیطی فراگیر و پویا به ترویج و ارتقای این دانش میپردازد. ما تلاش میکنیم تا علاقهمندان به این حوزه درک عمیقتری از هوش مصنوعی پیدا کنند، از جدیدترین تحولات آن در ایران و جهان مطلع شوند و فعالان و پیشروان این صنعت را بشناسند. هوشیو با تمرکز بر تولید محتوای چندرسانهای شامل ویدئوکست، پادکست، موشنگرافیک و … تجربهای جذاب و آموزنده برای مخاطبان فراهم میکند. همچنین، هوشیو با پوشش رسانهای گسترده رویدادهای هوش مصنوعی در ایران و جهان، بستری را برای اطلاعرسانی و تعامل میان فعالان و علاقهمندان این حوزه ایجاد کرده است.