Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 داده‌های کشور در مسیر یکپارچه‌سازی؛ آزمایشگاه مرجع ارزیابی مدل‌های زبان فارسی افتتاح شد

داده‌های کشور در مسیر یکپارچه‌سازی؛ آزمایشگاه مرجع ارزیابی مدل‌های زبان فارسی افتتاح شد

زمان مطالعه: 5 دقیقه

اپراتور ملی داده قرار است شکاف میان سازمان‌های دارنده داده و مصرف‌کنندگان این منابع را پر کند. حامد منکرسی جزئیات مأموریت این اپراتور در تبادل امن داده و توسعه هوش مصنوعی فارسی را تشریح می‌کند.

داده به یکی از مهم‌ترین زیرساخت‌های توسعه هوش مصنوعی تبدیل شده است؛ با این حال، پراکندگی منابع، ضعف در استانداردسازی و نگرانی‌های امنیتی و حریم خصوصی، دسترسی به داده‌های قابل استفاده را دشوار کرده است. در همین راستا، اپراتور ملی داده با هدف ایجاد ارتباط میان دارندگان و مصرف‌کنندگان داده و فراهم‌کردن بستر امن برای تبادل و استفاده از این منابع فعالیت خود را آغاز کرده است. در گفت‌وگو با «دکتر حامد منکرسی»، درباره مأموریت و سازوکار این اپراتور، امنیت داده‌ها و نقش آن در تأمین داده مورد نیاز مدل‌های هوش مصنوعی فارسی گفت‌وگو کرده‌ایم.

اپراتور ملی داده چگونه شکاف میان دارندگان و مصرف‌کنندگان داده را پر می‌کند؟

حامد منکرسی: اپراتور ملی داده در راستای برنامه تقسیم کار ملی هوش مصنوعی که سال گذشته در دولت به تصویب رسید، مجوز فعالیت خود را دریافت کرد و آغاز به کار کرد. وظیفه اصلی این اپراتور، پر کردن شکاف میان افراد و سازمان‌های دارنده داده و شرکت‌ها و سازمان‌هایی است که می‌توانند از این داده‌ها استفاده کنند.

البته مأموریت اپراتور ملی داده صرفاً به تبادل داده محدود نمی‌شود. داده‌ها پیش از تبادل باید پردازش، ارزیابی و از نظر کیفیت بررسی شوند. نقص‌های آنها باید برطرف و بر اساس استانداردها و پروتکل‌های مشخص آماده تبادل شوند. همچنین با استفاده از داده‌های مرجع، صحت داده‌ها بررسی می‌شود تا از درستی آنها اطمینان حاصل کنیم.

موضوع حریم خصوصی افراد و اسرار تجاری شرکت‌ها نیز باید بررسی شود تا اطلاعات محرمانه در فرآیند تبادل داده افشا نشود. مجموعه این فرآیندها در چارچوب حکمرانی داده در اپراتور ملی داده مدیریت می‌شود و با استفاده از ابزارهای فنی و حقوقی، داده‌ها به محصولاتی قابل تبادل برای سازمان‌ها و شرکت‌های مصرف‌کننده تبدیل می‌شوند.

یکی از چالش‌های اصلی، عدم اعتماد دستگاه‌ها به مصرف‌کنندگان داده است؛ چگونه این مشکل را حل می‌کنید؟

منکرسی: یکی از چالش‌های سازمان‌ها همین موضوع عدم اعتماد به دستگاه‌ها یا شرکت‌هایی است که مصرف‌کننده داده هستند. بنابراین لازم است یک نهاد سوم وجود داشته باشد که به دارنده داده تضمین دهد محرمانگی اطلاعات حفظ می‌شود و داده به شکل گمنام و امن در اختیار مصرف‌کننده قرار می‌گیرد.

ما می‌توانیم این موضوع را از نظر حقوقی تضمین کنیم و از نظر فنی نیز پروتکل‌ها را به شکلی تنظیم کنیم که این الزامات رعایت شود. برخی سازمان‌ها به بلوغ کافی رسیده‌اند و خودشان داده‌ها را گمنام و رمزگذاری می‌کنند، اما سازمان‌هایی که این توانمندی را ندارند یا نمی‌توانند هزینه آن را پرداخت کنند، می‌توانند از خدمات اپراتور داده برای گمنام‌سازی اطلاعات استفاده کنند.

با مشکل پراکندگی یا قدیمی بودن داده‌های سازمان‌ها هم مواجه هستید؟

منکرسی: بله. در بسیاری از سازمان‌ها داده‌های قدیمی حتی دیجیتال نشده‌اند و به شکل سنتی روی کاغذ نگهداری می‌شوند. دیجیتال‌سازی این اطلاعات هزینه زیادی دارد. ما در پلتفرم داده، خدماتی برای جمع‌آوری و یکپارچه‌سازی داده ارائه می‌کنیم.

از طرف دیگر ممکن است داده‌ای برای یک سازمان ارزش چندانی نداشته باشد، اما برای سازمان دیگری بسیار ارزشمند باشد و بتواند با استفاده از آن پایگاه داده خود را تکمیل کند. اپراتور ملی داده می‌تواند این شکاف‌ها را برطرف و به یکپارچه‌سازی داده‌ها کمک کند.

با توجه به افزایش حملات سایبری، آیا تجمیع داده‌ها در یک بستر، خطر امنیتی ایجاد نمی‌کند؟

منکرسی: اساساً هدف ما جمع‌آوری تمام داده‌ها در یک نقطه نیست. معماری‌های توزیع‌شده‌ای که امروز استفاده می‌شوند، امکان می‌دهند منابع داده روی بسترهای ابری و در محل‌های مختلف نگهداری شوند.

همچنین برای مراکز داده، برنامه‌های تداوم کسب‌وکار و بازیابی پس از بحران پیش‌بینی می‌شود. ما حتی پلتفرم نرم‌افزاری را در اختیار دارندگان داده قرار می‌دهیم تا بتوانند آن را در مجموعه خودشان مستقر کنند. این پلتفرم فرآیند مدیریت داده را استاندارد و پروتکل‌های لازم را در اختیار آنها قرار می‌دهد.

پس آیا خود داده‌ها به پلتفرم مرکزی منتقل نمی‌شوند؟

منکرسی: لزوماً نه. یکی از مواردی که سازمان‌ها می‌توانند به پلتفرم اصلی منتقل کنند، «کاتالوگ داده» است. کاتالوگ در واقع فهرستی از داده‌های موجود است و خود داده را شامل نمی‌شود؛ بلکه مشخص می‌کند چه نوع داده‌ای در دسترس است.

برای مثال اگر به دنبال اطلاعات مربوط به خسارت‌های بیمه‌ای باشم، ابتدا کاتالوگ را بررسی می‌کنم تا ببینم داده مورد نیازم وجود دارد یا خیر. سپس درخواست خود را بر اساس آن ثبت می‌کنم و دارنده داده می‌تواند اطلاعات را در اختیار مصرف‌کننده قرار دهد. در این فرآیند، اپراتور ملی داده می‌تواند نقش واسطه را ایفا کند.

یکی از حوزه‌هایی که روی آن کار می‌کنید، تأمین داده برای مدل‌های هوش مصنوعی است؛ چرا این موضوع اهمیت دارد؟

منکرسی: داده حوزه بسیار گسترده‌ای است و کاربردهای متعددی دارد. امروز مدل‌های بزرگ زبانی بر اساس حجم و کیفیت داده‌ای که به آن دسترسی دارند، توسعه پیدا کرده‌اند.

شرکت‌های بزرگ فناوری نیز به دلیل دسترسی به منابع عظیم داده توانسته‌اند مدل‌های قدرتمندی ایجاد کنند. برای مثال گوگل از داده‌های حاصل از موتور جست‌وجوی خود استفاده می‌کند و متا نیز به دلیل در اختیار داشتن داده‌های شبکه‌های اجتماعی خود، منابع گسترده‌ای برای توسعه مدل‌های هوش مصنوعی دارد.

ما در کشور چنین منابع متمرکزی را در این مقیاس در اختیار نداریم. از سوی دیگر، برخی مجموعه‌هایی که داده‌های ارزشمند دارند، هنوز به‌صورت جدی وارد این حوزه نشده‌اند.

برای تأمین داده مورد نیاز مدل‌های فارسی چه اقدامی انجام داده‌اید؟

منکرسی: ما وظیفه حاکمیتی خودمان می‌دانیم منابع اصلی و معتبر داده در کشور را شناسایی کنیم و با آنها تفاهم‌نامه همکاری داشته باشیم. برای نمونه، اخیراً با کتابخانه ملی تفاهم‌نامه‌ای امضا کردیم.

کتابخانه ملی حجم بسیار زیادی از داده‌های مربوط به منابع مکتوب را از سال‌های گذشته در اختیار دارد که می‌تواند برای توسعه مدل‌های بزرگ زبانی فارسی بسیار ارزشمند باشد. ما برای آموزش مدل‌هایی متناسب با فرهنگ و رویکرد ایرانی-اسلامی به چنین داده‌های معتبر و مستندی نیاز داریم.

مدل‌هایی که صرفاً بر اساس داده‌های عمومی اینترنت آموزش می‌بینند ممکن است با داده‌های نادرست، غیرمستند یا دارای سوگیری فرهنگی مواجه باشند. بنابراین تلاش می‌کنیم منابع معتبر داده را شناسایی و آنها را برای استفاده مدل‌های هوش مصنوعی آماده کنیم.

آیا این مدل‌ها داخل کشور میزبانی خواهند شد؟

منکرسی: بله. تلاش می‌کنیم مدل‌های معتبر را داخل کشور میزبانی کنیم تا حاکمیت داده حفظ شود و اطلاعات برای پردازش به خارج از کشور منتقل نشود. با توجه به محدودیت‌های ناشی از تحریم‌ها، این موضوع اهمیت بیشتری پیدا می‌کند.

در حال حاضر نیز برخی مدل‌های متن‌باز را در مراکز داده داخل کشور مستقر کرده‌ایم. سکوهای ملی هوش مصنوعی نیز با حمایت معاونت علمی توسعه پیدا کرده‌اند و برخی مدل‌ها در آنها مستقر شده‌اند.

البته از نظر کیفیت هنوز با مدل‌های جهانی مانند محصولات OpenAI فاصله داریم و استقبال کاربران نیز به اندازه نمونه‌های جهانی نیست. امیدواریم با فاین‌تیون‌کردن مدل‌ها و در اختیار قرار دادن داده‌های معتبر، کیفیت محصولات داخلی افزایش پیدا کند.

آزمایشگاه مرجع ارزیابی مدل‌های زبان فارسی که اخیراً افتتاح شد، چه نقشی دارد؟

منکرسی: امروز شرکت‌ها و استارتاپ‌های مختلف ادعا می‌کنند مدل بومی توسعه داده‌اند، اما معیار مشخص و مستقلی برای مقایسه کیفیت این مدل‌ها وجود نداشت.

ما با همکاری دانشگاه امیرکبیر آزمایشگاه مرجع ارزیابی مدل‌های زبان فارسی را راه‌اندازی کردیم تا این مدل‌ها به‌صورت دوره‌ای و از ابعاد مختلف ارزیابی شوند.

برای مثال، توانایی مدل در فهم مسائل ریاضی، مسائل حقوقی، زبان فارسی، ضرب‌المثل‌ها و ادبیات فارسی بررسی می‌شود و در نهایت نتایج در قالب یک رتبه‌بندی و لیدربرد منتشر خواهد شد.

این کار از یک سو به شرکت‌ها و فعالان این حوزه کمک می‌کند دائماً کیفیت محصولات خود را ارتقا دهند و از سوی دیگر، مصرف‌کنندگان می‌توانند هنگام انتخاب یک مدل، به جای تکیه بر چند جلسه دمو، عملکرد واقعی مدل را بر اساس یک ارزیابی مستقل مقایسه کنند.

در این آزمایشگاه چند هزار پرسش و پاسخ استاندارد برای ارزیابی مدل‌ها در نظر گرفته شده و پاسخ مدل‌ها بر اساس معیارهای مشخص بررسی می‌شود.

آیا نخستین نتایج این ارزیابی‌ها منتشر شده است؟

منکرسی: بله. در حال حاضر رتبه‌بندی مدل‌های متن‌باز انجام شده و نتایج آن در سایت «سینا اسمارت» منتشر شده است و علاقه‌مندان می‌توانند برای مشاهده نتایج به آن مراجعه کنند.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]