هوش مصنوعی و ویکیپدیا زبانهای آسیبپذیر را در مسیر نابودی قرار دادهاند
ترجمههای ماشینی باعث شدهاند تا ایجاد مقالههای پر از خطا در ویکیپدیا آسانتر از هر زمان دیگری باشد. وقتی مدلهای هوش مصنوعی روی همین صفحات بیکیفیت آموزش میبینند، چه اتفاقی میافتد؟
وقتی «کنت وِهر» چهار سال پیش مدیریت نسخه گرینلندی ویکیپدیا را بر عهده گرفت، اولین اقدام او حذف تقریباً همهی محتوا بود. او فکر میکرد اگر مقالهها باقی بمانند، شانس زنده ماندنشان بسیار کم است.
وِهر، که ۲۶ سال دارد، اهل گرینلند نیست و در آلمان بزرگ شده اما پس از سفری که در نوجوانی به این جزیره داشته، شیفته آن شده بود. او سالها در زبان مادری خود مقالههای کماهمیت و تخصصی درباره جزیره نوشته بود و حتی برای تحصیل زبان گرینلندی به کپنهاگ نقل مکان کرد. زبان گرینلندی حدود ۵۷ هزار نفر گوینده دارد که عمدتاً بومیان اینویت هستند و در دهها روستای پراکنده در منطقه قطبی زندگی میکنند.
نسخه گرینلندی ویکیپدیا حدود سال ۲۰۰۳ اضافه شد، تنها چند سال پس از راهاندازی سایت به زبان انگلیسی. تا زمانی که وِهر حدود ۲۰ سال بعد رهبری آن را به دست گرفت، صدها ویکینویس در آن مشارکت کرده و در مجموع حدود ۱۵۰۰ مقاله با دهها هزار کلمه نوشته بودند. به نظر میرسید این موفقیت، اثباتی برای مدل جمعسپاری ویکیپدیا باشد و نشان دهد حتی در کمترین احتمالها هم میتواند کارآمد باشد.
اما یک مشکل وجود داشت؛ ویکیپدیای گرینلندی، یک سراب بود.
داده بد، خروجی بد
تقریباً تمام مقالهها توسط افرادی نوشته شده بود که این زبان را واقعاً نمیدانستند. وِهر، که اکنون در دانمارک زبان گرینلندی تدریس میکند، حدس میزند شاید فقط یک یا دو گرینلندی واقعاً در نوشتن این مطالب مشارکت کرده باشند. اما چیزی که بیش از همه او را نگران میکرد، موضوع دیگری بود؛ با گذشت زمان، وِهر متوجه شد تعداد فزایندهای از مقالهها توسط افرادی که از ترجمه ماشینی استفاده میکردند، به ویکیپدیا اضافه شدهاند. این مقالهها پر از اشتباهات ابتدایی بودند. از خطاهای دستوری و واژههای بیمعنی تا اشتباهات جدیتر، مانند مقالهای که مدعی شده بود کانادا تنها ۴۱ نفر جمعیت دارد. برخی صفحات حاوی رشتههای تصادفی از حروف بودند که ماشینها نتوانسته بودند معادل مناسبی در زبان گرینلندی پیدا کنند.
وِهر میگوید: «ممکن بود به نظر نویسندگان، متن گرینلندی باشد، اما آنها هیچ راهی برای اطمینان نداشتند.» او اضافه میکند: «جملات اصلاً معنا نداشتند یا اشتباهات واضحی داشتند. ترجمههای ماشینی واقعاً در گرینلندی ضعیف هستند.»
آنچه وِهر توصیف میکند، تنها مربوط به نسخه گرینلندی نیست. ویکیپدیا بعد از کتاب مقدس، جاهطلبانهترین پروژه چندزبانه است؛ نسخههایی به بیش از ۳۴۰ زبان موجود است و حدود ۴۰۰ زبان حتی کمتر شناخته شده نیز در حال توسعه و آزمایش هستند. بسیاری از این نسخههای کوچک تحت سیل محتوای ترجمه شده خودکار قرار گرفتهاند، چرا که دسترسی به هوش مصنوعی آسانتر شده است.
به عنوان مثال، داوطلبان چهار زبان آفریقایی به MIT Technology Review گفتهاند که بین ۴۰ تا ۶۰ درصد مقالههای نسخههای ویکیپدیای آنها ترجمه ماشینی اصلاح نشده هستند. و پس از بررسی نسخه اینوکتیتوت، زبانی بومی نزدیک به گرینلندی که در کانادا صحبت میشود، MIT Technology Review تخمین زده است که بیش از دو سوم صفحات با بیش از چند جمله، شامل بخشهایی هستند که به این شیوه ایجاد شدهاند.
این امر در حال ایجاد یک مشکل جدی است. سیستمهای هوش مصنوعی، از گوگل ترنسلیت تا ChatGPT، زبانهای جدید را با جمعآوری حجم عظیمی از متن از اینترنت میآموزند. ویکیپدیا گاهی بزرگترین منبع دادههای زبانی آنلاین برای زبانهای با تعداد گوینده کم است؛ پس هر اشتباه در این صفحات، چه دستوری و چه غیره، میتواند منابعی را که هوش مصنوعی از آن تغذیه میکند، آلوده کند. این موضوع باعث میشود ترجمه این زبانها توسط مدلها به شدت مستعد خطا باشد و یک چرخه مخرب زبانی ایجاد میشود. مردم همچنان صفحات بدترجمه ویکیپدیا را با ابزارهای ماشینی ایجاد میکنند و مدلهای هوش مصنوعی از همان صفحات آموزش میبینند. مسئله پیچیده است، اما در اصل به یک مفهوم ساده خلاصه میشود: داده بد، خروجی بد.
«کوین اسکانل»، استاد سابق علوم کامپیوتر در دانشگاه سنت لوئیس که اکنون نرمافزاری ویژه زبانهای در معرض خطر میسازد، میگوید: «این مدلها روی دادههای خام ساخته شدهاند. آنها تلاش میکنند همه چیز درباره یک زبان را از صفر بیاموزند. هیچ ورودی دیگری وجود ندارد؛ هیچ کتاب گرامری، هیچ فرهنگ لغتی، هیچ چیز دیگری جز متنی که وارد میشود، وجود ندارد.»
داده کامل درباره مقیاس این مشکل موجود نیست، به ویژه که بسیاری از دادههای آموزش هوش مصنوعی محرمانه است و این حوزه با سرعت در حال تغییر است. اما در سال ۲۰۲۰، تخمین زده میشد ویکیپدیا بیش از نیمی از دادههای آموزشی که به مدلهای هوش مصنوعی برای ترجمه برخی زبانهای میلیونها نفره در آفریقا تغذیه میشد، را تشکیل میداد، از جمله مالاگاسی، یوروبا و شونا. در سال ۲۰۲۲، تیمی پژوهشی از آلمان که بررسی کرده بود چه دادههایی از طریق استخراج آنلاین قابل دسترسی است، حتی متوجه شد ویکیپدیا تنها منبع آنلاین قابل دسترس برای ۲۷ زبان کممنبع است.
این میتواند پیامدهای جدی داشته باشد، به ویژه وقتی ویکیپدیا ضعیف نوشته شده باشد. همچنین ممکن است آسیبپذیرترین زبانهای جهان را به آستانه نابودی سوق دهد، زیرا نسلهای آینده به تدریج از آنها رویگردان میشوند.
«تروند ترستِرود»، زبانشناس محاسباتی در دانشگاه ترومسو در نروژ که سالها هشدار داده درباره پیامدهای بالقوه ویرانگر نسخههای ضعیف ویکیپدیا، میگوید: «ویکیپدیا در مدلهای هوش مصنوعی این زبانها منعکس خواهد شد. سخت است تصور کنم که پیامدی نداشته باشد؛ و البته هرچه جایگاه ویکیپدیا قویتر باشد، اوضاع بدتر خواهد شد.»

استفاده مسئولانه
اتوماسیون از همان روزهای نخست ویکیپدیا در آن گنجانده شده است. رباتها به پایداری پلتفرم کمک میکنند؛ آنها لینکهای خراب را تعمیر میکنند، قالببندی اشتباه را اصلاح میکنند و حتی اشتباهات املایی را تصحیح میکنند. این وظایف تکراری و روزمره را میتوان بدون مشکل زیادی خودکارسازی کرد. حتی ارتشی از رباتها وجود دارند که با قرار دادن نام رودخانهها، شهرها یا حیوانات در عبارات الگو گونه، مقالات کوتاه تولید میکنند. به طور کلی، این رباتها باعث بهبود پلتفرم شدهاند.
اما هوش مصنوعی متفاوت است. هر کسی میتواند با چند کلیک، خسارات گستردهای ایجاد کند.
ویکیپدیا مدیریت ورود به عصر هوش مصنوعی را بهتر از بسیاری وبسایتهای دیگر انجام داده است. این سایت مانند شبکههای اجتماعی با سیل رباتهای هوش مصنوعی یا اطلاعات نادرست مواجه نشده است. تا حد زیادی، بیگناهیای که اینترنت در دوران ابتدایی داشت را حفظ کرده است. ویکیپدیا باز و رایگان است؛ هر کسی میتواند از آن استفاده کند، ویرایش کند و محتوا استخراج کند و توسط همان جامعهای اداره میشود که خدمت میکند. این شفاف و آسان برای استفاده است. اما پلتفرمهای مبتنی بر جامعه، حیات خود را بر اساس اندازه جامعهشان میسنجند. انگلیسی موفق شد، در حالی که گرینلندی سقوط کرد.
«امیر آهرونی»، عضو کمیته داوطلب زبان که درخواستهای باز یا بسته شدن نسخههای ویکیپدیا را نظارت میکند، میگوید: «ما به ویکینویسان خوب نیاز داریم. مردم این موضوع را بدیهی میگیرند. این جادو نیست. اگر از ترجمه ماشینی به صورت مسئولانه استفاده کنید، میتواند کارآمد و مفید باشد. متأسفانه نمیتوان به همه افراد اعتماد کرد که مسئولانه استفاده کنند.»

ترستِرود رفتار کاربران در نسخههای کوچک ویکیپدیا را مطالعه کرده و میگوید هوش مصنوعی به زیرمجموعهای از کاربران که او آنها را «ربایندگان ویکیپدیا» مینامد، قدرت داده است. این کاربران میتوانند طیف گستردهای داشته باشند؛ از نوجوانان سادهای که صفحهای درباره شهر زادگاهشان یا یوتیوبر مورد علاقهشان میسازند تا ویکینویسان خیرخواهی که فکر میکنند با ایجاد مقاله به زبانهای اقلیت، به نحوی در حال «کمک» به آن جوامع هستند.
ترستِرود میگوید: «مشکل این کاربران اکنون این است که مسلح به گوگل ترنسلیت هستند» و اضافه میکند که این ابزار به آنها اجازه میدهد محتواهایی بسیار طولانیتر و قابلباورتر تولید کنند، چیزی که قبلاً نمیتوانستند: «قبلاً تنها دیکشنری در اختیار داشتند.»
این امر عملاً عمل تخریب را صنعتی کرده است؛ که بیشترین تأثیر را روی زبانهای آسیبپذیر دارد، چرا که ترجمههای هوش مصنوعی معمولاً برای آنها بسیار کمتر قابل اعتماد است. دلایل مختلفی برای این موضوع وجود دارد، اما بخش قابلتوجهی از مسئله به کمبود نسبی متن منبع موجود آنلاین برمیگردد. گاهی مدلها در شناسایی زبان مشکل دارند، یا به این دلیل که زبان مشابه دیگری است، یا اینکه برخی زبانها، از جمله گرینلندی و بیشتر زبانهای بومی آمریکا، ساختارهایی دارند که با شیوه کار اکثر سیستمهای ترجمه ماشینی سازگار نیستند. (وِهر یادآوری میکند که در گرینلندی اکثر واژهها چسبندهاند؛ یعنی با افزودن پیشوند و پسوند به ریشهها ساخته میشوند. در نتیجه، بسیاری از واژهها بسیار وابسته به زمینه هستند و میتوانند مفاهیمی را بیان کنند که در دیگر زبانها نیازمند یک جمله کامل است.)
پژوهشی که گوگل پیش از گسترش بزرگ گوگل ترنسلیت سه سال پیش انجام داده بود، نشان داد سیستمهای ترجمه برای زبانهای کممنبع عموماً کیفیت پایینتری نسبت به زبانهای بهتر منبع دارند. به عنوان مثال، پژوهشگران مشاهده کردند مدل آنها اغلب اسامی اساسی را بین زبانها اشتباه ترجمه میکند، از جمله نام حیوانات و رنگها. (گوگل در بیانیهای به MIT Technology Review نوشته است که «متعهد به رعایت استاندارد بالای کیفیت برای همه ۲۴۹ زبانی است که پشتیبانی میکنیم، با آزمایش و بهبود دقیق سیستمها، به ویژه برای زبانهایی که ممکن است منابع متنی عمومی محدودی در وب داشته باشند.»)
ویکیپدیا خود یک ابزار ویرایش داخلی به نام Content Translate دارد که به کاربران اجازه میدهد مقالات را به صورت خودکار از یک زبان به زبان دیگر ترجمه کنند؛ ایده این است که با حفظ منابع و قالببندی اصلی، در وقت صرفهجویی شود. اما این ابزار بر سیستمهای ترجمه ماشینی خارجی متکی است و بنابراین عمدتاً از همان ضعفهایی رنج میبرد که دیگر ترجمه کنندههای ماشینی دارند؛ مشکلی که بنیاد ویکیمدیا (WikiMedia) میگوید حل آن دشوار است. تصمیم به استفاده از این ابزار بر عهده جامعه هر نسخه است و برخی از نسخهها استفاده از آن را ممنوع کردهاند. (به طور قابل توجه، ویکیپدیای انگلیسی عمدتاً استفاده از آن را ممنوع کرده است، زیرا حدود ۹۵ درصد مقالههای ایجاد شده با Content Translate بدون کار اضافی قابل قبول نبودند.) اما دستکم، تشخیص استفاده از این برنامه آسان است؛ Content Translate در بخش پشتی ویکیپدیا یک برچسب اضافه میکند.
برنامههای دیگر هوش مصنوعی ممکن است سختتر قابل کنترل باشند. با این حال، بسیاری از ویکینویسانی که با آنها صحبت کردم، گفتند وقتی زبانشان به ابزارهای ترجمه آنلاین اصلی اضافه شد، متوجه افزایش چشمگیر ایجاد صفحات ضعیف و احتمالاً ترجمه ماشینی شدند.
برخی ویکینویسانی که از هوش مصنوعی برای ترجمه محتوا استفاده میکنند، گاهی اذعان میکنند که زبان مقصد را بلد نیستند. آنها ممکن است خود را ارائه دهنده مقالههای خام برای جوامع کوچک ببینند تا گویندگان زبان بعداً آنها را اصلاح کنند؛ در اصل همان مدل موفقی که برای نسخههای فعالتر ویکیپدیا کار کرده است.
برای مثال، گوگل ترنسلیت میگوید واژه «فولفولده» برای «ژانویه» به معنای «ژوئن» است، در حالی که ChatGPT آن را «اوت» یا «سپتامبر» ترجمه میکند. این برنامهها همچنین پیشنهاد میدهند که واژه فولفولده برای برداشت محصول میتواند به معنای «تب» یا «سلامتی» باشد، در کنار سایر معانی ممکن.
اما وقتی صفحات پر از خطا در زبانهای کوچک تولید میشوند، معمولاً ارتشی از افراد دانا که به آن زبانها مسلط باشند، آماده بهبود آنها وجود ندارد. تعداد خوانندگان این نسخهها اندک است و گاهی حتی یک ویرایشگر ثابت هم وجود ندارد.
«یوئیت من لی»، معلمی کانادایی در دهه ۲۰ زندگی خود، میگوید که او ترکیبی از گوگل ترنسلیت و ChatGPT را برای ترجمه چند مقالهای که برای ویکیپدیای انگلیسی نوشته بود، به زبان اینوکتیتوت استفاده کرده است، با این تصور که میتواند به یک جامعه کوچک ویکیپدیا کمک کند. او میگوید برای یکی از مقالات یادداشتی اضافه کرده که ترجمه تنها یک نسخه خام است. او توضیح میدهد: «فکر نمیکردم کسی متوجه مقاله شود. وقتی چیزی در ویکیپدیاهای کوچک منتشر میکنید، اغلب هیچکس توجه نمیکند.»
با این حال، او اضافه میکند که هنوز فکر میکرد «شاید کسی آن را ببیند و اصلاح کند» و به این موضوع فکر کرده بود که ترجمه تولید شده توسط سیستمهای هوش مصنوعی از نظر دستوری صحیح باشد یا نه. از زمان ایجاد مقاله، هیچکس آن را ویرایش نکرده است.

لی که در ونکوور علوم اجتماعی تدریس میکند و ده سال پیش ویرایش مقالات ویکیپدیای انگلیسی را آغاز کرده، میگوید کاربران آشنا با ویکیپدیاهای فعالتر ممکن است قربانی این ذهنیت شوند، ذهنیتی که او آن را «غرور ویکیپدیا بزرگتر» مینامد؛ وقتی آنها سعی میکنند به نسخههای کوچکتر ویکیپدیا کمک کنند، فرض میکنند دیگران خواهند آمد و اشتباهاتشان را اصلاح میکنند. گاهی اوقات این روش کار میکند. لی میگوید قبلاً چندین مقاله به ویکیپدیای تاتاری، زبانی که چند میلیون نفر عمدتاً در روسیه به آن صحبت میکنند، اضافه کرده بود و حداقل یکی از آنها در نهایت اصلاح شد. اما در مقایسه، ویکیپدیای اینوکتیتوت «بیابان خشک» است.
او تأکید میکند که نیتش خوب بوده است؛ او میخواسته مقالات بیشتری به یک ویکیپدیا بومی کانادایی اضافه کند. او میگوید: «حالا فکر میکنم شاید ایده بدی بوده است. در نظر نگرفته بودم که ممکن است به یک حلقه بازگشتی کمک کنم. هدف تنها انتشار محتوا بود، از سر کنجکاوی و تفریح، بدون اندیشیدن درست به پیامدها.»
«قطعا هیچ آیندهای وجود نخواهد داشت»
ویکیپدیا پروژهای است که با خوشبینی چشمبهراه هدایت میشود. ویرایش میتواند کاری بیپاداش باشد، شامل هفتهها بحث و جدل با افراد ناشناس و مستعار، اما علاقهمندان ساعتها کار داوطلبانه انجام میدهند به خاطر تعهد به هدفی بالاتر. همین تعهد، محرک بسیاری از ویرایشگران منظم زبانهای کوچک است که با آنها صحبت کردم. همه آنها از ادامه حضور محتوای بیکیفیت در صفحات خود نگران بودند.
«عبدالقادر عبدالقادر»، متخصص برنامهریزی در کشاورزی ۲۶ ساله، که از شمال نیجریه از طریق تماس تلفنی با صدای خشدار با من صحبت میکرد، میگوید روزانه سه ساعت برای ویرایش مقالات به زبان مادری خود، فولفولده، که عمدتاً توسط کشاورزان و دامداران ساحل آفریقا استفاده میشود، صرف میکند. «اما کار بیش از حد است.»
عبدالقادر ضرورت فوری عملکرد صحیح ویکیپدیای فولفولده را میبیند. او آن را به عنوان یکی از منابع اندک آنلاین برای کشاورزان در روستاهای دورافتاده پیشنهاد میدهد که میتواند اطلاعاتی درباره بهترین دانهها یا محصولات برای زمینهای آنها به زبانی قابل فهم ارائه دهد. او به من گفت اگر مقالهای ترجمه ماشینی باشد، میتواند «به راحتی به آنها آسیب بزند»، چرا که احتمالاً اطلاعات به درستی به فولفولده ترجمه نشده است.
همانطور که پیشتر ذکر شد، گوگل ترنسلیت واژه فولفولده برای «ژانویه» را «ژوئن» ترجمه میکند و ChatGPT آن را «اوت» یا «سپتامبر» میداند. همچنین، واژه «برداشت محصول» را به «تب» یا «سلامتی» ترجمه میکنند، در کنار سایر معانی ممکن.
عبدالقادر گفت که اخیراً مجبور شده یک مقاله درباره لوبیای گاوی، محصول اصلی و کلیدی در بسیاری از مناطق آفریقا، را اصلاح کند، زیرا تقریباً غیرقابل خواندن بود.
او میگوید اگر کسی بخواهد صفحهای در ویکیپدیای فولفولده ایجاد کند، باید آن را به صورت دستی ترجمه کند. در غیر این صورت، «کسی که مقاله شما را میخواند، حتی دانش پایهای هم نخواهد داشت.» با این حال، او تخمین میزند که هنوز حدود ۶۰٪ مقالهها ترجمه ماشینی اصلاحنشده هستند. عبدالقادر به من گفت مگر اینکه تغییر مهمی در نحوه آموزش و استفاده سیستمهای هوش مصنوعی رخ دهد، چشمانداز فولفولده تاریک به نظر میرسد. او گفت: «واقعاً وضع وحشتناک خواهد بود. قطعا هیچ آیندهای وجود نخواهد داشت.»
در طرف دیگر کشور، «لوسی ایووآلا» به ویکیپدیای ایگبو، زبانی که چند میلیون نفر در جنوب شرقی نیجریه به آن صحبت میکنند، کمک میکند. او به من گفت: «آسیب قبلاً رخ داده است.» وقتی دو مقاله تازه ایجاد شده را باز کرد، هر دو به صورت خودکار از طریق Content Translate ویکیپدیا ترجمه شده بودند و آنقدر اشتباه داشتند که ادامه خواندن آنها باعث سردرد میشد. او اشاره کرد: «برخی اصطلاحات حتی ترجمه نشدهاند و هنوز به انگلیسی هستند.» او نام کاربری که صفحات را ایجاد کرده بود، به عنوان یک خاطی سریالی تشخیص داد. «حتی حروفی دارد که در زبان ایگبو استفاده نمیشوند.»
ایووآلا سه سال پیش به طور منظم در ویکیپدیا مشارکت کرد، زیرا نگران بود ایگبو توسط انگلیسی جایگزین شود. این نگرانی برای بسیاری از فعالان نسخههای کوچک ویکیپدیا مشترک است. او به من گفت: «این فرهنگ من است. این هویت من است. اصل موضوع همین است؛ اطمینان حاصل کنیم که پاک نمیشویم.»
ایووآلا، که اکنون به عنوان مترجم حرفهای بین انگلیسی و ایگبو فعالیت میکند، گفت کاربرانی که بیشترین آسیب را وارد میکنند، کمتجربه هستند و ترجمههای هوش مصنوعی را راهی برای افزایش سریع اعتبار ویکیپدیای ایگبو میبینند. او اغلب مجبور است در ویرایشگاههای آنلاین که برگزار میکند یا از طریق ایمیل به ویرایشگران خطاپذیر توضیح دهد که نتایج میتواند عکس آن باشد و کاربران را از ادامه مشارکت منصرف کند: «شما ناامید خواهید شد و دیگر نخواهید آمد. آن را رها خواهید کرد و به ویکیپدیای انگلیسی بازخواهید گشت.»

این نگرانیها توسط «نوا هاآلیلیو سولومون»، دانشیار زبان هاوایی در دانشگاه هاوایی نیز بیان شده است. او گزارش میدهد که حدود ۳۵٪ کلمات برخی صفحات ویکیپدیای هاوایی غیرقابل فهم هستند. «اگر این همان هاوایی باشد که آنلاین وجود دارد، بیشتر از هر چیز دیگری آسیب خواهد زد.»
زبان هاوایی که چند دهه پیش در آستانه انقراض بود، تحت تلاش بازیابی به رهبری فعالان و دانشگاهیان بومی قرار گرفته است. دیدن چنین هاوایی ضعیفی در پلتفرمی پرکاربرد مانند ویکیپدیا، سولومون را ناراحت میکند.
او میگوید: «این دردناک است، زیرا یادآور تمام دفعاتی است که فرهنگ و زبان ما مصادره شده است. ما با تمام توان برای احیای زبان مبارزه کردهایم. هیچ چیز آسان نبوده و این میتواند موانع بیشتری ایجاد کند. مردم فکر خواهند کرد این نمایشی دقیق از زبان هاوایی است.»
پیامد تمام این خطاهای ویکیپدیا میتواند سریعاً آشکار شود. مترجمهای هوش مصنوعی که بدون شک این صفحات را در دادههای آموزشی خود داشتهاند، اکنون در تولید کتابهای هوش مصنوعی پر از خطا برای زبانآموزانی که زبانهایی مانند اینوکتیتوت و کری، زبانهای بومی کانادا، و مانکس، زبان کوچک سلتیک در جزیره من، را میآموزند، کمک میکنند. بسیاری از این کتابها در آمازون به فروش میرسند. «ریچارد کامپتون»، زبانشناس دانشگاه کبک در مونترال، درباره یکی از این کتابها که ادعا شده بود کتاب عبارتهای مقدماتی اینوکتیتوت است، میگوید: «کاملاً بیمعنی بود.»
به جای آنکه زبانهای اقلیت را در دسترستر کند، هوش مصنوعی اکنون میدان مین گستردهای برای دانشآموزان و گویندگان این زبانها ایجاد کرده است. کامپتون میگوید: «این یک سیلی به صورت است.» او نگران است که نسلهای جوان کانادا که امیدوارند زبانها را در جوامعی یاد بگیرند که برای حفظ میراث خود مبارزه کردهاند، ممکن است به ابزارهای آنلاین مانند ChatGPT یا کتابهای عبارت در آمازون مراجعه کنند و اوضاع را بدتر کنند. او میگوید: «این تقلب است.»
مسابقه با زمان
طبق اعلام یونسکو، هر دو هفته یک زبان منقرض میشود. اما این سؤال که آیا بنیاد ویکیمدیا، که ویکیپدیا را اداره میکند، وظیفهای نسبت به زبانهای مورد استفاده در پلتفرم خود دارد یا خیر، همچنان باز است. وقتی با «رونا باتاچارجی»، مدیر ارشد بنیاد، صحبت کردم، او گفت تصمیمگیری درباره اینکه چه محتوایی باید در ویکیپدیای یک جامعه وجود داشته باشد، بر عهده خود آن جوامع است. او گفت: «در نهایت، مسئولیت واقعی بر دوش جامعه است تا مطمئن شود که هیچ خرابکاری یا فعالیت نامطلوبی رخ نمیدهد، چه از طریق ترجمه ماشینی یا روشهای دیگر.» باتاچارجی افزود که معمولاً نسخهها تنها در صورتی مورد بررسی برای بسته شدن قرار میگیرند که شکایت مشخصی درباره آنها مطرح شود.
اما اگر جامعه فعالی وجود نداشته باشد، چگونه میتوان نسخهای را اصلاح کرد یا حتی شکایتی مطرح کرد؟
باتاچارجی توضیح داد که بنیاد ویکیمدیا نقش خود را در چنین مواردی حفظ پلتفرم ویکیپدیا میداند، تا اگر کسی آمد بتواند آن را احیا کند: «این فضایی است که ما برای رشد و توسعه آنها فراهم میکنیم.»
زبان «ایناری سامی»، که در یک جامعه دورافتاده در شمال فنلاند صحبت میشود، نمونهای از این است که چگونه مردم میتوانند از ویکیپدیا به خوبی استفاده کنند. این زبان چهار دهه پیش در آستانه انقراض بود؛ تنها چهار کودک به آن صحبت میکردند. والدین آنها انجمن زبان ایناری سامی را در آخرین تلاش برای حفظ زبان ایجاد کردند. این تلاشها موفق شد. اکنون چند صد نفر به این زبان صحبت میکنند، مدارس از ایناری سامی به عنوان زبان آموزش استفاده میکنند و ۶۴۰۰ مقاله ویکیپدیا به این زبان وجود دارد که هر یک توسط یک گوینده مسلط ویرایش شدهاند.
این موفقیت نشان میدهد که ویکیپدیا واقعاً میتواند به جوامع کوچک و مصمم یک ابزار منحصر به فرد برای ترویج حفظ زبانشان ارائه دهد. «فابریتزیو برچیارولی»، عضو انجمن زبان ایناری سامی، میگوید: «ما به کمیت اهمیت نمیدهیم، کیفیت مهم است. ما برنامهریزی کردهایم تا از ویکیپدیا به عنوان مخزن زبان نوشتاری استفاده کنیم. باید ابزارهایی فراهم کنیم که نسلهای جوان بتوانند از آن استفاده کنند. مهم است که آنها بتوانند از ایناری سامی به صورت دیجیتال استفاده کنند.»
برچیارولی اضافه میکند که این موفقیت به قدری بوده است که ویکیپدیا در برنامه درسی مدارس صحبت کننده به ایناری سامی ادغام شده است. او تماسهایی از معلمان دریافت میکند که از او میخواهند صفحات سادهای درباره موضوعاتی از گردبادها تا فولکلور سامی بنویسد. ویکیپدیا حتی راهی برای معرفی واژههای جدید به ایناری سامی فراهم کرده است. برچیارولی میگوید: «ما مجبوریم همیشه واژههای جدید بسازیم. جوانان به آنها نیاز دارند تا درباره ورزش، سیاست و بازیهای ویدئویی صحبت کنند. اگر مطمئن نباشند چگونه چیزی را بگویند، حالا به ویکیپدیا مراجعه میکنند.»
ویکیپدیا یک تجربه فکری عظیم است. آنچه با ایناری سامی رخ داده نشان میدهد که با مراقبت حداکثری، میتواند در زبانهای کوچک نیز موفق باشد. برچیارولی میگوید: «هدف نهایی این است که مطمئن شویم ایناری سامی زنده میماند. شاید خوب باشد که گوگل ترنسلیت برای ایناری سامی وجود نداشته باشد.»
این ممکن است درست باشد؛ اگرچه مدلهای زبان بزرگ مانند ChatGPT میتوانند برای ترجمه عبارات به زبانهایی استفاده شوند که ابزارهای ترجمه ماشینی سنتی ارائه نمیدهند. برچیارولی گفت که ChatGPT در ایناری سامی خیلی خوب نیست، اما کیفیت آن بسته به پرسش متفاوت است؛ اگر سوالی به این زبان بپرسید، پاسخ پر از واژههای فنلاندی و حتی واژههای اختراعی خواهد بود. اما اگر چیزی را به انگلیسی، فنلاندی یا ایتالیایی بپرسید و سپس بخواهید پاسخ به ایناری سامی باشد، عملکرد بهتری خواهد داشت.
با توجه به همه اینها، تولید هر چه بیشتر محتوای با کیفیت آنلاین به مسابقهای با زمان تبدیل میشود. برچیارولی میگوید: «ChatGPT فقط به تعداد زیادی واژه نیاز دارد. اگر ما به گذاشتن مطالب خوب ادامه دهیم، دیر یا زود نتیجه خواهیم گرفت. این امید است.» این ایده توسط چند زبانشناس که با آنها صحبت کردم نیز تأیید شده است. اینکه ممکن است بتوان چرخه «زباله وارد، زباله خارج» را متوقف کرد. (OpenAI که ChatGPT را اداره میکند، به درخواست مصاحبه پاسخ نداد.)
با این حال، مشکل کلی احتمالاً بزرگتر و بزرگتر خواهد شد، زیرا بسیاری از زبانها به اندازه ایناری سامی خوششانس نیستند و ترجمه کنندههای هوش مصنوعی آنها احتمالاً بیشتر و بیشتر با محتوای بیکیفیت آموزش میبینند. وِهر، متأسفانه، درباره آینده گرینلندی محبوب خود، خوشبین نیست.
از زمان حذف بخش عمده ویکیپدیای گرینلندی، او سالها تلاش کرده است تا گویندگان را برای کمک به احیای آن جذب کند. او در رسانههای گرینلندی حضور پیدا کرده و از طریق شبکههای اجتماعی فراخوان داده است. اما پاسخ زیادی دریافت نکرده است؛ او میگوید این امر دلسردکننده بوده است.
او میگوید: «هیچکس در گرینلند علاقهمند به این موضوع نیست یا نمیخواهد مشارکت کند. کاملاً بیفایده است و به همین دلیل باید بسته شود.»
اواخر سال گذشته، او روندی را برای درخواست از کمیته زبان ویکیپدیا برای تعطیلی نسخه گرینلندی آغاز کرد. ماهها بحث تلخ بین دهها بوروکرات ویکیپدیا ادامه داشت؛ برخی از آنها شگفتزده بودند که یک نسخه که ظاهراً سالم به نظر میرسید، میتواند با این همه مشکل مواجه باشد.
سپس، اوایل این ماه، پیشنهاد وِهر پذیرفته شد؛ ویکیپدیای گرینلندی قرار است تعطیل شود و هر مقاله باقیمانده به ویکیپدیا انکوباتور منتقل شود، جایی که نسخههای جدید زبانها تست و ساخته میشوند. یکی از دلایل ذکر شده توسط کمیته زبان، استفاده از ابزارهای هوش مصنوعی است که «اغلب محتوای بیمعنی تولید کردهاند که میتواند زبان را نادرست نشان دهد.»
با این حال، ممکن است خیلی دیر باشد؛ خطاهای موجود در گرینلندی ظاهراً قبلاً در ترجمه کنندههای ماشینی جا افتادهاند. اگر از گوگل ترنسلیت یا ChatGPT بخواهید کاری ساده مانند شمارش از ۱ تا ۱۰ به گرینلندی درست انجام دهند، هیچیک نمیتوانند آن را ارائه کنند.
این مقاله نخستین بار در MIT Technology Review منتشر شده است.