جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 هوش مصنوعی و ویکی‌پدیا زبان‌های آسیب‌پذیر را در مسیر نابودی قرار داده‌اند

هوش مصنوعی و ویکی‌پدیا زبان‌های آسیب‌پذیر را در مسیر نابودی قرار داده‌اند

زمان مطالعه: 14 دقیقه

ترجمه‌های ماشینی باعث‌ شده‌اند تا ایجاد مقاله‌های پر از خطا در ویکی‌پدیا آسان‌تر از هر زمان دیگری باشد. وقتی مدل‌های هوش مصنوعی روی همین صفحات بی‌کیفیت آموزش می‌بینند، چه اتفاقی می‌افتد؟

وقتی «کنت وِهر» چهار سال پیش مدیریت نسخه گرینلندی ویکی‌پدیا را بر عهده گرفت، اولین اقدام او حذف تقریباً همه‌ی محتوا بود. او فکر می‌کرد اگر مقاله‌ها باقی بمانند، شانس زنده ماندنشان بسیار کم است.

وِهر، که ۲۶ سال دارد، اهل گرینلند نیست و در آلمان بزرگ شده اما پس از سفری که در نوجوانی به این جزیره داشته، شیفته آن شده بود. او سال‌ها در زبان مادری خود مقاله‌های کم‌اهمیت و تخصصی درباره جزیره نوشته بود و حتی برای تحصیل زبان گرینلندی به کپنهاگ نقل مکان کرد. زبان گرینلندی حدود ۵۷ هزار نفر گوینده دارد که عمدتاً بومیان اینویت هستند و در ده‌ها روستای پراکنده در منطقه قطبی زندگی می‌کنند.

نسخه گرینلندی ویکی‌پدیا حدود سال ۲۰۰۳ اضافه شد، تنها چند سال پس از راه‌اندازی سایت به زبان انگلیسی. تا زمانی که وِهر حدود ۲۰ سال بعد رهبری آن را به دست گرفت، صدها ویکی‌نویس در آن مشارکت کرده و در مجموع حدود ۱۵۰۰ مقاله با ده‌ها هزار کلمه نوشته بودند. به نظر می‌رسید این موفقیت، اثباتی برای مدل جمع‌سپاری ویکی‌پدیا باشد و نشان دهد حتی در کم‌ترین احتمال‌ها هم می‌تواند کارآمد باشد.

اما یک مشکل وجود داشت؛ ویکی‌پدیای گرینلندی، یک سراب بود.

داده بد، خروجی بد

تقریباً تمام مقاله‌ها توسط افرادی نوشته شده بود که این زبان را واقعاً نمی‌دانستند. وِهر، که اکنون در دانمارک زبان گرینلندی تدریس می‌کند، حدس می‌زند شاید فقط یک یا دو گرینلندی واقعاً در نوشتن این مطالب مشارکت کرده باشند. اما چیزی که بیش از همه او را نگران می‌کرد، موضوع دیگری بود؛ با گذشت زمان، وِهر متوجه شد تعداد فزاینده‌ای از مقاله‌ها توسط افرادی که از ترجمه ماشینی استفاده می‌کردند، به ویکی‌پدیا اضافه شده‌اند. این مقاله‌ها پر از اشتباهات ابتدایی بودند. از خطاهای دستوری و واژه‌های بی‌معنی تا اشتباهات جدی‌تر، مانند مقاله‌ای که مدعی شده بود کانادا تنها ۴۱ نفر جمعیت دارد. برخی صفحات حاوی رشته‌های تصادفی از حروف بودند که ماشین‌ها نتوانسته بودند معادل مناسبی در زبان گرینلندی پیدا کنند.

وِهر می‌گوید: «ممکن بود به نظر نویسندگان، متن گرینلندی باشد، اما آن‌ها هیچ راهی برای اطمینان نداشتند.» او اضافه می‌کند: «جملات اصلاً معنا نداشتند یا اشتباهات واضحی داشتند. ترجمه‌های ماشینی واقعاً در گرینلندی ضعیف هستند.»

آنچه وِهر توصیف می‌کند، تنها مربوط به نسخه گرینلندی نیست. ویکی‌پدیا بعد از کتاب مقدس، جاه‌طلبانه‌ترین پروژه چندزبانه است؛ نسخه‌هایی به بیش از ۳۴۰ زبان موجود است و حدود ۴۰۰ زبان حتی کمتر شناخته ‌شده نیز در حال توسعه و آزمایش هستند. بسیاری از این نسخه‌های کوچک تحت سیل محتوای ترجمه ‌شده خودکار قرار گرفته‌اند، چرا که دسترسی به هوش مصنوعی آسان‌تر شده است.

 به عنوان مثال، داوطلبان چهار زبان آفریقایی به MIT Technology Review گفته‌اند که بین ۴۰ تا ۶۰ درصد مقاله‌های نسخه‌های ویکی‌پدیای آن‌ها ترجمه ماشینی اصلاح ‌نشده هستند. و پس از بررسی نسخه اینوکتیتوت، زبانی بومی نزدیک به گرینلندی که در کانادا صحبت می‌شود، MIT Technology Review تخمین زده است که بیش از دو سوم صفحات با بیش از چند جمله، شامل بخش‌هایی هستند که به این شیوه ایجاد شده‌اند.

این امر در حال ایجاد یک مشکل جدی است. سیستم‌های هوش مصنوعی، از گوگل ترنسلیت تا ChatGPT، زبان‌های جدید را با جمع‌آوری حجم عظیمی از متن از اینترنت می‌آموزند. ویکی‌پدیا گاهی بزرگ‌ترین منبع داده‌های زبانی آنلاین برای زبان‌های با تعداد گوینده کم است؛ پس هر اشتباه در این صفحات، چه دستوری و چه غیره، می‌تواند منابعی را که هوش مصنوعی از آن تغذیه می‌کند، آلوده کند. این موضوع باعث می‌شود ترجمه این زبان‌ها توسط مدل‌ها به شدت مستعد خطا باشد و یک چرخه مخرب زبانی ایجاد می‌شود. مردم همچنان صفحات بدترجمه ویکی‌پدیا را با ابزارهای ماشینی ایجاد می‌کنند و مدل‌های هوش مصنوعی از همان صفحات آموزش می‌بینند. مسئله پیچیده است، اما در اصل به یک مفهوم ساده خلاصه می‌شود: داده بد، خروجی بد.

«کوین اسکانل»، استاد سابق علوم کامپیوتر در دانشگاه سنت لوئیس که اکنون نرم‌افزاری ویژه زبان‌های در معرض خطر می‌سازد، می‌گوید: «این مدل‌ها روی داده‌های خام ساخته شده‌اند. آن‌ها تلاش می‌کنند همه چیز درباره یک زبان را از صفر بیاموزند. هیچ ورودی دیگری وجود ندارد؛ هیچ کتاب گرامری، هیچ فرهنگ لغتی، هیچ چیز دیگری جز متنی که وارد می‌شود، وجود ندارد.»

داده کامل درباره مقیاس این مشکل موجود نیست، به ویژه که بسیاری از داده‌های آموزش هوش مصنوعی محرمانه است و این حوزه با سرعت در حال تغییر است. اما در سال ۲۰۲۰، تخمین زده می‌شد ویکی‌پدیا بیش از نیمی از داده‌های آموزشی که به مدل‌های هوش مصنوعی برای ترجمه برخی زبان‌های میلیون‌ها نفره در آفریقا تغذیه می‌شد، را تشکیل می‌داد، از جمله مالاگاسی، یوروبا و شونا. در سال ۲۰۲۲، تیمی پژوهشی از آلمان که بررسی کرده بود چه داده‌هایی از طریق استخراج آنلاین قابل دسترسی است، حتی متوجه شد ویکی‌پدیا تنها منبع آنلاین قابل دسترس برای ۲۷ زبان کم‌منبع است.

این می‌تواند پیامدهای جدی داشته باشد، به ویژه وقتی ویکی‌پدیا ضعیف نوشته شده باشد. همچنین ممکن است آسیب‌پذیرترین زبان‌های جهان را به آستانه نابودی سوق دهد، زیرا نسل‌های آینده به تدریج از آن‌ها رویگردان می‌شوند.

«تروند ترستِرود»، زبان‌شناس محاسباتی در دانشگاه ترومسو در نروژ که سال‌ها هشدار داده درباره پیامدهای بالقوه ویرانگر نسخه‌های ضعیف ویکی‌پدیا، می‌گوید: «ویکی‌پدیا در مدل‌های هوش مصنوعی این زبان‌ها منعکس خواهد شد. سخت است تصور کنم که پیامدی نداشته باشد؛ و البته هرچه جایگاه ویکی‌پدیا قوی‌تر باشد، اوضاع بدتر خواهد شد.»

استفاده مسئولانه

اتوماسیون از همان روزهای نخست ویکی‌پدیا در آن گنجانده شده است. ربات‌ها به پایداری پلتفرم کمک می‌کنند؛ آن‌ها لینک‌های خراب را تعمیر می‌کنند، قالب‌بندی اشتباه را اصلاح می‌کنند و حتی اشتباهات املایی را تصحیح می‌کنند. این وظایف تکراری و روزمره را می‌توان بدون مشکل زیادی خودکارسازی کرد. حتی ارتشی از ربات‌ها وجود دارند که با قرار دادن نام رودخانه‌ها، شهرها یا حیوانات در عبارات الگو گونه، مقالات کوتاه تولید می‌کنند. به طور کلی، این ربات‌ها باعث بهبود پلتفرم شده‌اند.

اما هوش مصنوعی متفاوت است. هر کسی می‌تواند با چند کلیک، خسارات گسترده‌ای ایجاد کند.

ویکی‌پدیا مدیریت ورود به عصر هوش مصنوعی را بهتر از بسیاری وب‌سایت‌های دیگر انجام داده است. این سایت مانند شبکه‌های اجتماعی با سیل ربات‌های هوش مصنوعی یا اطلاعات نادرست مواجه نشده است. تا حد زیادی، بی‌گناهی‌ای که اینترنت در دوران ابتدایی داشت را حفظ کرده است. ویکی‌پدیا باز و رایگان است؛ هر کسی می‌تواند از آن استفاده کند، ویرایش کند و محتوا استخراج کند و توسط همان جامعه‌ای اداره می‌شود که خدمت می‌کند. این شفاف و آسان برای استفاده است. اما پلتفرم‌های مبتنی بر جامعه، حیات خود را بر اساس اندازه جامعه‌شان می‌سنجند. انگلیسی موفق شد، در حالی که گرینلندی سقوط کرد.

«امیر آهرونی»، عضو کمیته داوطلب زبان که درخواست‌های باز یا بسته شدن نسخه‌های ویکی‌پدیا را نظارت می‌کند، می‌گوید: «ما به ویکی‌نویسان خوب نیاز داریم. مردم این موضوع را بدیهی می‌گیرند. این جادو نیست. اگر از ترجمه ماشینی به صورت مسئولانه استفاده کنید، می‌تواند کارآمد و مفید باشد. متأسفانه نمی‌توان به همه افراد اعتماد کرد که مسئولانه استفاده کنند.»

ترستِرود رفتار کاربران در نسخه‌های کوچک ویکی‌پدیا را مطالعه کرده و می‌گوید هوش مصنوعی به زیرمجموعه‌ای از کاربران که او آن‌ها را «ربایندگان ویکی‌پدیا» می‌نامد، قدرت داده است. این کاربران می‌توانند طیف گسترده‌ای داشته باشند؛ از نوجوانان ساده‌ای که صفحه‌ای درباره شهر زادگاهشان یا یوتیوبر مورد علاقه‌شان می‌سازند تا ویکی‌نویسان خیرخواهی که فکر می‌کنند با ایجاد مقاله به زبان‌های اقلیت، به نحوی در حال «کمک» به آن جوامع هستند.

ترستِرود می‌گوید: «مشکل این کاربران اکنون این است که مسلح به گوگل ترنسلیت هستند» و اضافه می‌کند که این ابزار به آن‌ها اجازه می‌دهد محتواهایی بسیار طولانی‌تر و قابل‌باورتر تولید کنند، چیزی که قبلاً نمی‌توانستند: «قبلاً تنها دیکشنری در اختیار داشتند.»

این امر عملاً عمل تخریب را صنعتی کرده است؛ که بیشترین تأثیر را روی زبان‌های آسیب‌پذیر دارد، چرا که ترجمه‌های هوش مصنوعی معمولاً برای آن‌ها بسیار کمتر قابل اعتماد است. دلایل مختلفی برای این موضوع وجود دارد، اما بخش قابل‌توجهی از مسئله به کمبود نسبی متن منبع موجود آنلاین برمی‌گردد. گاهی مدل‌ها در شناسایی زبان مشکل دارند، یا به این دلیل که زبان مشابه دیگری است، یا اینکه برخی زبان‌ها، از جمله گرینلندی و بیشتر زبان‌های بومی آمریکا، ساختارهایی دارند که با شیوه کار اکثر سیستم‌های ترجمه ماشینی سازگار نیستند. (وِهر یادآوری می‌کند که در گرینلندی اکثر واژه‌ها چسبنده‌اند؛ یعنی با افزودن پیشوند و پسوند به ریشه‌ها ساخته می‌شوند. در نتیجه، بسیاری از واژه‌ها بسیار وابسته به زمینه هستند و می‌توانند مفاهیمی را بیان کنند که در دیگر زبان‌ها نیازمند یک جمله کامل است.)

پژوهشی که گوگل پیش از گسترش بزرگ گوگل ترنسلیت سه سال پیش انجام داده بود، نشان داد سیستم‌های ترجمه برای زبان‌های کم‌منبع عموماً کیفیت پایین‌تری نسبت به زبان‌های بهتر منبع دارند. به عنوان مثال، پژوهشگران مشاهده کردند مدل آن‌ها اغلب اسامی اساسی را بین زبان‌ها اشتباه ترجمه می‌کند، از جمله نام حیوانات و رنگ‌ها. (گوگل در بیانیه‌ای به MIT Technology Review نوشته است که «متعهد به رعایت استاندارد بالای کیفیت برای همه ۲۴۹ زبانی است که پشتیبانی می‌کنیم، با آزمایش و بهبود دقیق سیستم‌ها، به ویژه برای زبان‌هایی که ممکن است منابع متنی عمومی محدودی در وب داشته باشند.»)

ویکی‌پدیا خود یک ابزار ویرایش داخلی به نام Content Translate دارد که به کاربران اجازه می‌دهد مقالات را به صورت خودکار از یک زبان به زبان دیگر ترجمه کنند؛ ایده این است که با حفظ منابع و قالب‌بندی اصلی، در وقت صرفه‌جویی شود. اما این ابزار بر سیستم‌های ترجمه ماشینی خارجی متکی است و بنابراین عمدتاً از همان ضعف‌هایی رنج می‌برد که دیگر ترجمه ‌کننده‌های ماشینی دارند؛ مشکلی که بنیاد ویکی‌مدیا (WikiMedia) می‌گوید حل آن دشوار است. تصمیم به استفاده از این ابزار بر عهده جامعه هر نسخه است و برخی از نسخه‌ها استفاده از آن را ممنوع کرده‌اند. (به طور قابل توجه، ویکی‌پدیای انگلیسی عمدتاً استفاده از آن را ممنوع کرده است، زیرا حدود ۹۵ درصد مقاله‌های ایجاد شده با Content Translate بدون کار اضافی قابل قبول نبودند.) اما دست‌کم، تشخیص استفاده از این برنامه آسان است؛ Content Translate در بخش پشتی ویکی‌پدیا یک برچسب اضافه می‌کند.

برنامه‌های دیگر هوش مصنوعی ممکن است سخت‌تر قابل کنترل باشند. با این حال، بسیاری از ویکی‌نویسانی که با آن‌ها صحبت کردم، گفتند وقتی زبانشان به ابزارهای ترجمه آنلاین اصلی اضافه شد، متوجه افزایش چشمگیر ایجاد صفحات ضعیف و احتمالاً ترجمه ماشینی شدند.

برخی ویکی‌نویسانی که از هوش مصنوعی برای ترجمه محتوا استفاده می‌کنند، گاهی اذعان می‌کنند که زبان مقصد را بلد نیستند. آن‌ها ممکن است خود را ارائه ‌دهنده مقاله‌های خام برای جوامع کوچک ببینند تا گویندگان زبان بعداً آن‌ها را اصلاح کنند؛ در اصل همان مدل موفقی که برای نسخه‌های فعال‌تر ویکی‌پدیا کار کرده است.

برای مثال، گوگل ترنسلیت می‌گوید واژه «فولفولده» برای «ژانویه» به معنای «ژوئن» است، در حالی که ChatGPT آن را «اوت» یا «سپتامبر» ترجمه می‌کند. این برنامه‌ها همچنین پیشنهاد می‌دهند که واژه فولفولده برای برداشت محصول می‌تواند به معنای «تب» یا «سلامتی» باشد، در کنار سایر معانی ممکن.

اما وقتی صفحات پر از خطا در زبان‌های کوچک تولید می‌شوند، معمولاً ارتشی از افراد دانا که به آن زبان‌ها مسلط باشند، آماده بهبود آن‌ها وجود ندارد. تعداد خوانندگان این نسخه‌ها اندک است و گاهی حتی یک ویرایشگر ثابت هم وجود ندارد.

«یوئیت من لی»، معلمی کانادایی در دهه ۲۰ زندگی خود، می‌گوید که او ترکیبی از گوگل ترنسلیت و ChatGPT را برای ترجمه چند مقاله‌ای که برای ویکی‌پدیای انگلیسی نوشته بود، به زبان اینوکتیتوت استفاده کرده است، با این تصور که می‌تواند به یک جامعه کوچک ویکی‌پدیا کمک کند. او می‌گوید برای یکی از مقالات یادداشتی اضافه کرده که ترجمه تنها یک نسخه خام است. او توضیح می‌دهد: «فکر نمی‌کردم کسی متوجه مقاله شود. وقتی چیزی در ویکی‌پدیاهای کوچک منتشر می‌کنید، اغلب هیچ‌کس توجه نمی‌کند.»

با این حال، او اضافه می‌کند که هنوز فکر می‌کرد «شاید کسی آن را ببیند و اصلاح کند» و به این موضوع فکر کرده بود که ترجمه تولید شده توسط سیستم‌های هوش مصنوعی از نظر دستوری صحیح باشد یا نه. از زمان ایجاد مقاله، هیچ‌کس آن را ویرایش نکرده است.

لی که در ونکوور علوم اجتماعی تدریس می‌کند و ده سال پیش ویرایش مقالات ویکی‌پدیای انگلیسی را آغاز کرده، می‌گوید کاربران آشنا با ویکی‌پدیاهای فعال‌تر ممکن است قربانی این ذهنیت شوند، ذهنیتی که او آن را «غرور ویکی‌پدیا بزرگ‌تر» می‌نامد؛ وقتی آن‌ها سعی می‌کنند به نسخه‌های کوچک‌تر ویکی‌پدیا کمک کنند، فرض می‌کنند دیگران خواهند آمد و اشتباهاتشان را اصلاح می‌کنند. گاهی اوقات این روش کار می‌کند. لی می‌گوید قبلاً چندین مقاله به ویکی‌پدیای تاتاری، زبانی که چند میلیون نفر عمدتاً در روسیه به آن صحبت می‌کنند، اضافه کرده بود و حداقل یکی از آن‌ها در نهایت اصلاح شد. اما در مقایسه، ویکی‌پدیای اینوکتیتوت «بیابان خشک» است.

او تأکید می‌کند که نیتش خوب بوده است؛ او می‌خواسته مقالات بیشتری به یک ویکی‌پدیا بومی کانادایی اضافه کند. او می‌گوید: «حالا فکر می‌کنم شاید ایده بدی بوده است. در نظر نگرفته بودم که ممکن است به یک حلقه بازگشتی کمک کنم. هدف تنها انتشار محتوا بود، از سر کنجکاوی و تفریح، بدون اندیشیدن درست به پیامدها.»

«قطعا هیچ آینده‌ای وجود نخواهد داشت»

ویکی‌پدیا پروژه‌ای است که با خوش‌بینی چشم‌به‌راه هدایت می‌شود. ویرایش می‌تواند کاری بی‌پاداش باشد، شامل هفته‌ها بحث و جدل با افراد ناشناس و مستعار، اما علاقه‌مندان ساعت‌ها کار داوطلبانه انجام می‌دهند به خاطر تعهد به هدفی بالاتر. همین تعهد، محرک بسیاری از ویرایشگران منظم زبان‌های کوچک است که با آن‌ها صحبت کردم. همه آن‌ها از ادامه حضور محتوای بی‌کیفیت در صفحات خود نگران بودند.

«عبدالقادر عبدالقادر»، متخصص برنامه‌ریزی در کشاورزی ۲۶ ساله، که از شمال نیجریه از طریق تماس تلفنی با صدای خش‌دار با من صحبت می‌کرد، می‌گوید روزانه سه ساعت برای ویرایش مقالات به زبان مادری خود، فولفولده، که عمدتاً توسط کشاورزان و دامداران ساحل آفریقا استفاده می‌شود، صرف می‌کند. «اما کار بیش از حد است.»

عبدالقادر ضرورت فوری عملکرد صحیح ویکی‌پدیای فولفولده را می‌بیند. او آن را به عنوان یکی از منابع اندک آنلاین برای کشاورزان در روستاهای دورافتاده پیشنهاد می‌دهد که می‌تواند اطلاعاتی درباره بهترین دانه‌ها یا محصولات برای زمین‌های آن‌ها به زبانی قابل فهم ارائه دهد. او به من گفت اگر مقاله‌ای ترجمه ماشینی باشد، می‌تواند «به راحتی به آن‌ها آسیب بزند»، چرا که احتمالاً اطلاعات به درستی به فولفولده ترجمه نشده است.

همان‌طور که پیش‌تر ذکر شد، گوگل ترنسلیت واژه فولفولده برای «ژانویه» را «ژوئن» ترجمه می‌کند و ChatGPT آن را «اوت» یا «سپتامبر» می‌داند. همچنین، واژه «برداشت محصول» را به «تب» یا «سلامتی» ترجمه می‌کنند، در کنار سایر معانی ممکن.

عبدالقادر گفت که اخیراً مجبور شده یک مقاله درباره لوبیای گاوی، محصول اصلی و کلیدی در بسیاری از مناطق آفریقا، را اصلاح کند، زیرا تقریباً غیرقابل خواندن بود.

او می‌گوید اگر کسی بخواهد صفحه‌ای در ویکی‌پدیای فولفولده ایجاد کند، باید آن را به صورت دستی ترجمه کند. در غیر این صورت، «کسی که مقاله شما را می‌خواند، حتی دانش پایه‌ای هم نخواهد داشت.» با این حال، او تخمین می‌زند که هنوز حدود ۶۰٪ مقاله‌ها ترجمه ماشینی اصلاح‌نشده هستند. عبدالقادر به من گفت مگر اینکه تغییر مهمی در نحوه آموزش و استفاده سیستم‌های هوش مصنوعی رخ دهد، چشم‌انداز فولفولده تاریک به نظر می‌رسد. او گفت: «واقعاً وضع وحشتناک خواهد بود. قطعا هیچ‌ آینده‌ای وجود نخواهد داشت.»

در طرف دیگر کشور، «لوسی ایووآلا» به ویکی‌پدیای ایگبو، زبانی که چند میلیون نفر در جنوب شرقی نیجریه به آن صحبت می‌کنند، کمک می‌کند. او به من گفت: «آسیب قبلاً رخ داده است.» وقتی دو مقاله تازه ایجاد شده را باز کرد، هر دو به صورت خودکار از طریق Content Translate ویکی‌پدیا ترجمه شده بودند و آن‌قدر اشتباه داشتند که ادامه خواندن آن‌ها باعث سردرد می‌شد. او اشاره کرد: «برخی اصطلاحات حتی ترجمه نشده‌اند و هنوز به انگلیسی هستند.» او نام کاربری که صفحات را ایجاد کرده بود، به عنوان یک خاطی سریالی تشخیص داد. «حتی حروفی دارد که در زبان ایگبو استفاده نمی‌شوند.»

ایووآلا سه سال پیش به طور منظم در ویکی‌پدیا مشارکت کرد، زیرا نگران بود ایگبو توسط انگلیسی جایگزین شود. این نگرانی برای بسیاری از فعالان نسخه‌های کوچک ویکی‌پدیا مشترک است. او به من گفت: «این فرهنگ من است. این هویت من است. اصل موضوع همین است؛ اطمینان حاصل کنیم که پاک نمی‌شویم.»

ایووآلا، که اکنون به عنوان مترجم حرفه‌ای بین انگلیسی و ایگبو فعالیت می‌کند، گفت کاربرانی که بیشترین آسیب را وارد می‌کنند، کم‌تجربه هستند و ترجمه‌های هوش مصنوعی را راهی برای افزایش سریع اعتبار ویکی‌پدیای ایگبو می‌بینند. او اغلب مجبور است در ویرایشگاه‌های آنلاین که برگزار می‌کند یا از طریق ایمیل به ویرایشگران خطاپذیر توضیح دهد که نتایج می‌تواند عکس آن باشد و کاربران را از ادامه مشارکت منصرف کند: «شما ناامید خواهید شد و دیگر نخواهید آمد. آن را رها خواهید کرد و به ویکی‌پدیای انگلیسی بازخواهید گشت.»

این نگرانی‌ها توسط «نوا هاآلیلیو سولومون»، دانشیار زبان هاوایی در دانشگاه هاوایی نیز بیان شده است. او گزارش می‌دهد که حدود ۳۵٪ کلمات برخی صفحات ویکی‌پدیای هاوایی غیرقابل فهم هستند. «اگر این همان هاوایی باشد که آنلاین وجود دارد، بیشتر از هر چیز دیگری آسیب خواهد زد.»

زبان هاوایی که چند دهه پیش در آستانه انقراض بود، تحت تلاش بازیابی به رهبری فعالان و دانشگاهیان بومی قرار گرفته است. دیدن چنین هاوایی ضعیفی در پلتفرمی پرکاربرد مانند ویکی‌پدیا، سولومون را ناراحت می‌کند.

او می‌گوید: «این دردناک است، زیرا یادآور تمام دفعاتی است که فرهنگ و زبان ما مصادره شده است. ما با تمام توان برای احیای زبان مبارزه کرده‌ایم. هیچ چیز آسان نبوده و این می‌تواند موانع بیشتری ایجاد کند. مردم فکر خواهند کرد این نمایشی دقیق از زبان هاوایی است.»

پیامد تمام این خطاهای ویکی‌پدیا می‌تواند سریعاً آشکار شود. مترجم‌های هوش مصنوعی که بدون شک این صفحات را در داده‌های آموزشی خود داشته‌اند، اکنون در تولید کتاب‌های هوش مصنوعی پر از خطا برای زبان‌آموزانی که زبان‌هایی مانند اینوکتیتوت و کری، زبان‌های بومی کانادا، و مانکس، زبان کوچک سلتیک در جزیره من، را می‌آموزند، کمک می‌کنند. بسیاری از این کتاب‌ها در آمازون به فروش می‌رسند. «ریچارد کامپتون»، زبان‌شناس دانشگاه کبک در مونترال، درباره یکی از این کتاب‌ها که ادعا شده بود کتاب عبارت‌های مقدماتی اینوکتیتوت است، می‌گوید: «کاملاً بی‌معنی بود.»

به جای آنکه زبان‌های اقلیت را در دسترس‌تر کند، هوش مصنوعی اکنون میدان مین گسترده‌ای برای دانش‌آموزان و گویندگان این زبان‌ها ایجاد کرده است. کامپتون می‌گوید: «این یک سیلی به صورت است.» او نگران است که نسل‌های جوان کانادا که امیدوارند زبان‌ها را در جوامعی یاد بگیرند که برای حفظ میراث خود مبارزه کرده‌اند، ممکن است به ابزارهای آنلاین مانند ChatGPT یا کتاب‌های عبارت در آمازون مراجعه کنند و اوضاع را بدتر کنند. او می‌گوید: «این تقلب است.»

مسابقه با زمان

طبق اعلام یونسکو، هر دو هفته یک زبان منقرض می‌شود. اما این سؤال که آیا بنیاد ویکی‌مدیا، که ویکی‌پدیا را اداره می‌کند، وظیفه‌ای نسبت به زبان‌های مورد استفاده در پلتفرم خود دارد یا خیر، همچنان باز است. وقتی با «رونا باتاچارجی»، مدیر ارشد بنیاد، صحبت کردم، او گفت تصمیم‌گیری درباره اینکه چه محتوایی باید در ویکی‌پدیای یک جامعه وجود داشته باشد، بر عهده خود آن جوامع است. او گفت: «در نهایت، مسئولیت واقعی بر دوش جامعه است تا مطمئن شود که هیچ خرابکاری یا فعالیت نامطلوبی رخ نمی‌دهد، چه از طریق ترجمه ماشینی یا روش‌های دیگر.» باتاچارجی افزود که معمولاً نسخه‌ها تنها در صورتی مورد بررسی برای بسته شدن قرار می‌گیرند که شکایت مشخصی درباره آن‌ها مطرح شود.

اما اگر جامعه فعالی وجود نداشته باشد، چگونه می‌توان نسخه‌ای را اصلاح کرد یا حتی شکایتی مطرح کرد؟

باتاچارجی توضیح داد که بنیاد ویکی‌مدیا نقش خود را در چنین مواردی حفظ پلتفرم ویکی‌پدیا می‌داند، تا اگر کسی آمد بتواند آن را احیا کند: «این فضایی است که ما برای رشد و توسعه آن‌ها فراهم می‌کنیم.»

زبان «ایناری سامی»، که در یک جامعه دورافتاده در شمال فنلاند صحبت می‌شود، نمونه‌ای از این است که چگونه مردم می‌توانند از ویکی‌پدیا به خوبی استفاده کنند. این زبان چهار دهه پیش در آستانه انقراض بود؛ تنها چهار کودک به آن صحبت می‌کردند. والدین آن‌ها انجمن زبان ایناری سامی را در آخرین تلاش برای حفظ زبان ایجاد کردند. این تلاش‌ها موفق شد. اکنون چند صد نفر به این زبان صحبت می‌کنند، مدارس از ایناری سامی به عنوان زبان آموزش استفاده می‌کنند و ۶۴۰۰ مقاله ویکی‌پدیا به این زبان وجود دارد که هر یک توسط یک گوینده مسلط ویرایش شده‌اند.

این موفقیت نشان می‌دهد که ویکی‌پدیا واقعاً می‌تواند به جوامع کوچک و مصمم یک ابزار منحصر به فرد برای ترویج حفظ زبانشان ارائه دهد. «فابریتزیو برچیارولی»، عضو انجمن زبان ایناری سامی، می‌گوید: «ما به کمیت اهمیت نمی‌دهیم، کیفیت مهم است. ما برنامه‌ریزی کرده‌ایم تا از ویکی‌پدیا به عنوان مخزن زبان نوشتاری استفاده کنیم. باید ابزارهایی فراهم کنیم که نسل‌های جوان بتوانند از آن استفاده کنند. مهم است که آن‌ها بتوانند از ایناری سامی به صورت دیجیتال استفاده کنند.»

برچیارولی اضافه می‌کند که این موفقیت به قدری بوده است که ویکی‌پدیا در برنامه درسی مدارس صحبت‌ کننده به ایناری سامی ادغام شده است. او تماس‌هایی از معلمان دریافت می‌کند که از او می‌خواهند صفحات ساده‌ای درباره موضوعاتی از گردبادها تا فولکلور سامی بنویسد. ویکی‌پدیا حتی راهی برای معرفی واژه‌های جدید به ایناری سامی فراهم کرده است. برچیارولی می‌گوید: «ما مجبوریم همیشه واژه‌های جدید بسازیم. جوانان به آن‌ها نیاز دارند تا درباره ورزش، سیاست و بازی‌های ویدئویی صحبت کنند. اگر مطمئن نباشند چگونه چیزی را بگویند، حالا به ویکی‌پدیا مراجعه می‌کنند.»

ویکی‌پدیا یک تجربه فکری عظیم است. آنچه با ایناری سامی رخ داده نشان می‌دهد که با مراقبت حداکثری، می‌تواند در زبان‌های کوچک نیز موفق باشد. برچیارولی می‌گوید: «هدف نهایی این است که مطمئن شویم ایناری سامی زنده می‌ماند. شاید خوب باشد که گوگل ترنسلیت برای ایناری سامی وجود نداشته باشد.»

این ممکن است درست باشد؛ اگرچه مدل‌های زبان بزرگ مانند ChatGPT می‌توانند برای ترجمه عبارات به زبان‌هایی استفاده شوند که ابزارهای ترجمه ماشینی سنتی ارائه نمی‌دهند. برچیارولی گفت که ChatGPT در ایناری سامی خیلی خوب نیست، اما کیفیت آن بسته به پرسش متفاوت است؛ اگر سوالی به این زبان بپرسید، پاسخ پر از واژه‌های فنلاندی و حتی واژه‌های اختراعی خواهد بود. اما اگر چیزی را به انگلیسی، فنلاندی یا ایتالیایی بپرسید و سپس بخواهید پاسخ به ایناری سامی باشد، عملکرد بهتری خواهد داشت.

با توجه به همه این‌ها، تولید هر چه بیشتر محتوای با کیفیت آنلاین به مسابقه‌ای با زمان تبدیل می‌شود. برچیارولی می‌گوید: «ChatGPT فقط به تعداد زیادی واژه نیاز دارد. اگر ما به گذاشتن مطالب خوب ادامه دهیم، دیر یا زود نتیجه خواهیم گرفت. این امید است.» این ایده توسط چند زبان‌شناس که با آن‌ها صحبت کردم نیز تأیید شده است. اینکه ممکن است بتوان چرخه «زباله وارد، زباله خارج» را متوقف کرد. (OpenAI که ChatGPT را اداره می‌کند، به درخواست مصاحبه پاسخ نداد.)

با این حال، مشکل کلی احتمالاً بزرگ‌تر و بزرگ‌تر خواهد شد، زیرا بسیاری از زبان‌ها به اندازه ایناری سامی خوش‌شانس نیستند و ترجمه‌ کننده‌های هوش مصنوعی آن‌ها احتمالاً بیشتر و بیشتر با محتوای بی‌کیفیت آموزش می‌بینند. وِهر، متأسفانه، درباره آینده گرینلندی محبوب خود، خوش‌بین نیست.

از زمان حذف بخش عمده ویکی‌پدیای گرینلندی، او سال‌ها تلاش کرده است تا گویندگان را برای کمک به احیای آن جذب کند. او در رسانه‌های گرینلندی حضور پیدا کرده و از طریق شبکه‌های اجتماعی فراخوان داده است. اما پاسخ زیادی دریافت نکرده است؛ او می‌گوید این امر دلسردکننده بوده است.

او می‌گوید: «هیچ‌کس در گرینلند علاقه‌مند به این موضوع نیست یا نمی‌خواهد مشارکت کند. کاملاً بی‌فایده است و به همین دلیل باید بسته شود.»

اواخر سال گذشته، او روندی را برای درخواست از کمیته زبان ویکی‌پدیا برای تعطیلی نسخه گرینلندی آغاز کرد. ماه‌ها بحث تلخ بین ده‌ها بوروکرات ویکی‌پدیا ادامه داشت؛ برخی از آن‌ها شگفت‌زده بودند که یک نسخه که ظاهراً سالم به نظر می‌رسید، می‌تواند با این همه مشکل مواجه باشد.

سپس، اوایل این ماه، پیشنهاد وِهر پذیرفته شد؛ ویکی‌پدیای گرینلندی قرار است تعطیل شود و هر مقاله باقی‌مانده به ویکی‌پدیا انکوباتور منتقل شود، جایی که نسخه‌های جدید زبان‌ها تست و ساخته می‌شوند. یکی از دلایل ذکر شده توسط کمیته زبان، استفاده از ابزارهای هوش مصنوعی است که «اغلب محتوای بی‌معنی تولید کرده‌اند که می‌تواند زبان را نادرست نشان دهد.»

با این حال، ممکن است خیلی دیر باشد؛ خطاهای موجود در گرینلندی ظاهراً قبلاً در ترجمه ‌کننده‌های ماشینی جا افتاده‌اند. اگر از گوگل ترنسلیت یا ChatGPT بخواهید کاری ساده مانند شمارش از ۱ تا ۱۰ به گرینلندی درست انجام دهند، هیچ‌یک نمی‌توانند آن را ارائه کنند.

این مقاله نخستین بار در MIT Technology Review منتشر شده است.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]