دادههای کشور در مسیر یکپارچهسازی؛ آزمایشگاه مرجع ارزیابی مدلهای زبان فارسی افتتاح شد
اپراتور ملی داده قرار است شکاف میان سازمانهای دارنده داده و مصرفکنندگان این منابع را پر کند. حامد منکرسی جزئیات مأموریت این اپراتور در تبادل امن داده و توسعه هوش مصنوعی فارسی را تشریح میکند.
داده به یکی از مهمترین زیرساختهای توسعه هوش مصنوعی تبدیل شده است؛ با این حال، پراکندگی منابع، ضعف در استانداردسازی و نگرانیهای امنیتی و حریم خصوصی، دسترسی به دادههای قابل استفاده را دشوار کرده است. در همین راستا، اپراتور ملی داده با هدف ایجاد ارتباط میان دارندگان و مصرفکنندگان داده و فراهمکردن بستر امن برای تبادل و استفاده از این منابع فعالیت خود را آغاز کرده است. در گفتوگو با «دکتر حامد منکرسی»، درباره مأموریت و سازوکار این اپراتور، امنیت دادهها و نقش آن در تأمین داده مورد نیاز مدلهای هوش مصنوعی فارسی گفتوگو کردهایم.
اپراتور ملی داده چگونه شکاف میان دارندگان و مصرفکنندگان داده را پر میکند؟
حامد منکرسی: اپراتور ملی داده در راستای برنامه تقسیم کار ملی هوش مصنوعی که سال گذشته در دولت به تصویب رسید، مجوز فعالیت خود را دریافت کرد و آغاز به کار کرد. وظیفه اصلی این اپراتور، پر کردن شکاف میان افراد و سازمانهای دارنده داده و شرکتها و سازمانهایی است که میتوانند از این دادهها استفاده کنند.
البته مأموریت اپراتور ملی داده صرفاً به تبادل داده محدود نمیشود. دادهها پیش از تبادل باید پردازش، ارزیابی و از نظر کیفیت بررسی شوند. نقصهای آنها باید برطرف و بر اساس استانداردها و پروتکلهای مشخص آماده تبادل شوند. همچنین با استفاده از دادههای مرجع، صحت دادهها بررسی میشود تا از درستی آنها اطمینان حاصل کنیم.
موضوع حریم خصوصی افراد و اسرار تجاری شرکتها نیز باید بررسی شود تا اطلاعات محرمانه در فرآیند تبادل داده افشا نشود. مجموعه این فرآیندها در چارچوب حکمرانی داده در اپراتور ملی داده مدیریت میشود و با استفاده از ابزارهای فنی و حقوقی، دادهها به محصولاتی قابل تبادل برای سازمانها و شرکتهای مصرفکننده تبدیل میشوند.
یکی از چالشهای اصلی، عدم اعتماد دستگاهها به مصرفکنندگان داده است؛ چگونه این مشکل را حل میکنید؟
منکرسی: یکی از چالشهای سازمانها همین موضوع عدم اعتماد به دستگاهها یا شرکتهایی است که مصرفکننده داده هستند. بنابراین لازم است یک نهاد سوم وجود داشته باشد که به دارنده داده تضمین دهد محرمانگی اطلاعات حفظ میشود و داده به شکل گمنام و امن در اختیار مصرفکننده قرار میگیرد.
ما میتوانیم این موضوع را از نظر حقوقی تضمین کنیم و از نظر فنی نیز پروتکلها را به شکلی تنظیم کنیم که این الزامات رعایت شود. برخی سازمانها به بلوغ کافی رسیدهاند و خودشان دادهها را گمنام و رمزگذاری میکنند، اما سازمانهایی که این توانمندی را ندارند یا نمیتوانند هزینه آن را پرداخت کنند، میتوانند از خدمات اپراتور داده برای گمنامسازی اطلاعات استفاده کنند.
با مشکل پراکندگی یا قدیمی بودن دادههای سازمانها هم مواجه هستید؟
منکرسی: بله. در بسیاری از سازمانها دادههای قدیمی حتی دیجیتال نشدهاند و به شکل سنتی روی کاغذ نگهداری میشوند. دیجیتالسازی این اطلاعات هزینه زیادی دارد. ما در پلتفرم داده، خدماتی برای جمعآوری و یکپارچهسازی داده ارائه میکنیم.
از طرف دیگر ممکن است دادهای برای یک سازمان ارزش چندانی نداشته باشد، اما برای سازمان دیگری بسیار ارزشمند باشد و بتواند با استفاده از آن پایگاه داده خود را تکمیل کند. اپراتور ملی داده میتواند این شکافها را برطرف و به یکپارچهسازی دادهها کمک کند.
با توجه به افزایش حملات سایبری، آیا تجمیع دادهها در یک بستر، خطر امنیتی ایجاد نمیکند؟
منکرسی: اساساً هدف ما جمعآوری تمام دادهها در یک نقطه نیست. معماریهای توزیعشدهای که امروز استفاده میشوند، امکان میدهند منابع داده روی بسترهای ابری و در محلهای مختلف نگهداری شوند.
همچنین برای مراکز داده، برنامههای تداوم کسبوکار و بازیابی پس از بحران پیشبینی میشود. ما حتی پلتفرم نرمافزاری را در اختیار دارندگان داده قرار میدهیم تا بتوانند آن را در مجموعه خودشان مستقر کنند. این پلتفرم فرآیند مدیریت داده را استاندارد و پروتکلهای لازم را در اختیار آنها قرار میدهد.
پس آیا خود دادهها به پلتفرم مرکزی منتقل نمیشوند؟
منکرسی: لزوماً نه. یکی از مواردی که سازمانها میتوانند به پلتفرم اصلی منتقل کنند، «کاتالوگ داده» است. کاتالوگ در واقع فهرستی از دادههای موجود است و خود داده را شامل نمیشود؛ بلکه مشخص میکند چه نوع دادهای در دسترس است.
برای مثال اگر به دنبال اطلاعات مربوط به خسارتهای بیمهای باشم، ابتدا کاتالوگ را بررسی میکنم تا ببینم داده مورد نیازم وجود دارد یا خیر. سپس درخواست خود را بر اساس آن ثبت میکنم و دارنده داده میتواند اطلاعات را در اختیار مصرفکننده قرار دهد. در این فرآیند، اپراتور ملی داده میتواند نقش واسطه را ایفا کند.
یکی از حوزههایی که روی آن کار میکنید، تأمین داده برای مدلهای هوش مصنوعی است؛ چرا این موضوع اهمیت دارد؟
منکرسی: داده حوزه بسیار گستردهای است و کاربردهای متعددی دارد. امروز مدلهای بزرگ زبانی بر اساس حجم و کیفیت دادهای که به آن دسترسی دارند، توسعه پیدا کردهاند.
شرکتهای بزرگ فناوری نیز به دلیل دسترسی به منابع عظیم داده توانستهاند مدلهای قدرتمندی ایجاد کنند. برای مثال گوگل از دادههای حاصل از موتور جستوجوی خود استفاده میکند و متا نیز به دلیل در اختیار داشتن دادههای شبکههای اجتماعی خود، منابع گستردهای برای توسعه مدلهای هوش مصنوعی دارد.
ما در کشور چنین منابع متمرکزی را در این مقیاس در اختیار نداریم. از سوی دیگر، برخی مجموعههایی که دادههای ارزشمند دارند، هنوز بهصورت جدی وارد این حوزه نشدهاند.
برای تأمین داده مورد نیاز مدلهای فارسی چه اقدامی انجام دادهاید؟
منکرسی: ما وظیفه حاکمیتی خودمان میدانیم منابع اصلی و معتبر داده در کشور را شناسایی کنیم و با آنها تفاهمنامه همکاری داشته باشیم. برای نمونه، اخیراً با کتابخانه ملی تفاهمنامهای امضا کردیم.
کتابخانه ملی حجم بسیار زیادی از دادههای مربوط به منابع مکتوب را از سالهای گذشته در اختیار دارد که میتواند برای توسعه مدلهای بزرگ زبانی فارسی بسیار ارزشمند باشد. ما برای آموزش مدلهایی متناسب با فرهنگ و رویکرد ایرانی-اسلامی به چنین دادههای معتبر و مستندی نیاز داریم.
مدلهایی که صرفاً بر اساس دادههای عمومی اینترنت آموزش میبینند ممکن است با دادههای نادرست، غیرمستند یا دارای سوگیری فرهنگی مواجه باشند. بنابراین تلاش میکنیم منابع معتبر داده را شناسایی و آنها را برای استفاده مدلهای هوش مصنوعی آماده کنیم.
آیا این مدلها داخل کشور میزبانی خواهند شد؟
منکرسی: بله. تلاش میکنیم مدلهای معتبر را داخل کشور میزبانی کنیم تا حاکمیت داده حفظ شود و اطلاعات برای پردازش به خارج از کشور منتقل نشود. با توجه به محدودیتهای ناشی از تحریمها، این موضوع اهمیت بیشتری پیدا میکند.
در حال حاضر نیز برخی مدلهای متنباز را در مراکز داده داخل کشور مستقر کردهایم. سکوهای ملی هوش مصنوعی نیز با حمایت معاونت علمی توسعه پیدا کردهاند و برخی مدلها در آنها مستقر شدهاند.
البته از نظر کیفیت هنوز با مدلهای جهانی مانند محصولات OpenAI فاصله داریم و استقبال کاربران نیز به اندازه نمونههای جهانی نیست. امیدواریم با فاینتیونکردن مدلها و در اختیار قرار دادن دادههای معتبر، کیفیت محصولات داخلی افزایش پیدا کند.
آزمایشگاه مرجع ارزیابی مدلهای زبان فارسی که اخیراً افتتاح شد، چه نقشی دارد؟
منکرسی: امروز شرکتها و استارتاپهای مختلف ادعا میکنند مدل بومی توسعه دادهاند، اما معیار مشخص و مستقلی برای مقایسه کیفیت این مدلها وجود نداشت.
ما با همکاری دانشگاه امیرکبیر آزمایشگاه مرجع ارزیابی مدلهای زبان فارسی را راهاندازی کردیم تا این مدلها بهصورت دورهای و از ابعاد مختلف ارزیابی شوند.
برای مثال، توانایی مدل در فهم مسائل ریاضی، مسائل حقوقی، زبان فارسی، ضربالمثلها و ادبیات فارسی بررسی میشود و در نهایت نتایج در قالب یک رتبهبندی و لیدربرد منتشر خواهد شد.
این کار از یک سو به شرکتها و فعالان این حوزه کمک میکند دائماً کیفیت محصولات خود را ارتقا دهند و از سوی دیگر، مصرفکنندگان میتوانند هنگام انتخاب یک مدل، به جای تکیه بر چند جلسه دمو، عملکرد واقعی مدل را بر اساس یک ارزیابی مستقل مقایسه کنند.
در این آزمایشگاه چند هزار پرسش و پاسخ استاندارد برای ارزیابی مدلها در نظر گرفته شده و پاسخ مدلها بر اساس معیارهای مشخص بررسی میشود.
آیا نخستین نتایج این ارزیابیها منتشر شده است؟
منکرسی: بله. در حال حاضر رتبهبندی مدلهای متنباز انجام شده و نتایج آن در سایت «سینا اسمارت» منتشر شده است و علاقهمندان میتوانند برای مشاهده نتایج به آن مراجعه کنند.
