غولهای هوش مصنوعی بر سر «تقطیر مدلها» به جان هم افتادند
همزمان با افزایش رقابت در صنعت هوش مصنوعی، OpenAI، گوگل و Anthropic نسبت به استفاده رقبا از خروجی مدلهایشان برای آموزش مدلهای جدید هشدار دادهاند؛ روشی که با عنوان «تقطیر مدل» (Model Distillation) شناخته میشود و میتواند هزینه توسعه مدلهای پیشرفته را بهشدت کاهش دهد.
در هفتههای اخیر، Anthropic اعلام کرده است که برخی رقبا با استخراج گسترده پاسخهای مدلهای هوش مصنوعی این شرکت، در حال بازسازی قابلیتهای آن هستند؛ فرآیندی که در صنعت هوش مصنوعی با عنوان «تقطیر» شناخته میشود. به گفته این شرکت، چنین اقدامی میتواند میلیاردها دلار سرمایهگذاری در تحقیق و توسعه را بیاثر کند، زیرا رقبا بدون پرداخت هزینههای سنگین آموزش مدل، بخشی از تواناییهای آن را با هزینهای بسیار کمتر بازتولید میکنند. OpenAI و گوگل نیز در ماههای اخیر نسبت به سوءاستفاده از خروجی مدلهای هوش مصنوعی خود هشدار دادهاند و این روند را تهدیدی برای مزیت رقابتی شرکتهای توسعهدهنده مدلهای بزرگ زبانی میدانند.
این همان کاری است که غولهای AI با اینترنت انجام دادند
اما منتقدان میگویند اعتراض امروز شرکتهای هوش مصنوعی، شباهت زیادی به اعتراض چند سال اخیر ناشران، رسانهها و صاحبان وبسایتها دارد. این شرکتها سالها استدلال میکردند که اطلاعات منتشرشده در اینترنت را میتوان تحت اصل «استفاده منصفانه» (Fair Use) برای آموزش مدلهای هوش مصنوعی به کار گرفت؛ حتی اگر صاحبان محتوا رضایت مستقیمی نداده باشند. اکنون نیز منتقدان میپرسند اگر استفاده از دادههای وب برای آموزش مدلها مجاز بوده است، چرا استفاده از خروجی همین مدلها برای آموزش مدلهای دیگر نباید قابل قبول باشد؟
در این میان، Anthropic بیش از دیگر شرکتها هدف انتقاد قرار گرفته است. برخی تحلیلگران معتقدند این شرکت که همواره خود را یکی از اخلاقمدارترین بازیگران حوزه هوش مصنوعی معرفی کرده، از فعالترین شرکتها در جمعآوری دادههای وب بوده است. منتقدان میگویند رباتهای این شرکت بارها و بارها صفحات وب را خزیدهاند، در حالی که سهم ناچیزی از کاربران را دوباره به همان وبسایتها بازگرداندهاند؛ موضوعی که علاوه بر استفاده بدون مجوز از محتوا، هزینه زیرساختی بسیاری از وبسایتها را نیز افزایش داده است.
مرز میان «تقطیر» و «سرقت» کجاست؟
کارشناسان هوش مصنوعی تأکید میکنند که همه انواع تقطیر یکسان نیستند.
در شکل رایج این فناوری، شرکتها از خروجی مدلهای خود برای ساخت نسخههای کوچکتر، سریعتر یا ارزانتر همان مدل استفاده میکنند؛ روشی که سالها در صنعت هوش مصنوعی به کار رفته است. اما موضوعی که اکنون محل اختلاف شده، استفاده از خروجی مدل یک شرکت برای آموزش یا بهبود مدل متعلق به شرکتی دیگر است. با این حال، حتی در میان پژوهشگران نیز اجماع روشنی درباره مرز قانونی و اخلاقی این کار وجود ندارد و برخی هشدار میدهند که سختگیری بیش از حد میتواند توسعه فناوری تقطیر را به طور کلی با مشکل مواجه کند.
کارشناسان معتقدند شرکتهای بزرگ هوش مصنوعی طی ماههای اخیر تلاش کردهاند با محدود کردن دسترسی به مدلهای پیشرفته خود، از استخراج اطلاعات توسط رقبا جلوگیری کنند. با این حال، بسیاری بر این باورند که همانطور که محتوای منتشرشده در اینترنت دیر یا زود راهی برای کپی شدن پیدا میکند، خروجی مدلهای هوش مصنوعی نیز از این قاعده مستثنی نخواهد بود. به گفته پژوهشگران، این رقابت بیش از هر چیز به یک بازی دائمی «موش و گربه» شباهت دارد؛ جایی که توسعهدهندگان مدلها همواره به دنبال بستن راههای سوءاستفاده هستند و رقبا نیز روشهای تازهای برای دور زدن این محدودیتها پیدا میکنند.
افزایش اختلاف بر سر «تقطیر مدلها» نشان میدهد صنعت هوش مصنوعی وارد مرحله تازهای از منازعات حقوقی شده است؛ مرحلهای که دیگر تنها درباره استفاده از دادههای اینترنت نیست، بلکه خود خروجی مدلهای هوش مصنوعی نیز به دارایی ارزشمندی تبدیل شده که شرکتها برای حفاظت از آن به میدان آمدهاند.
اکنون پرسش اصلی این است که آیا قوانین مالکیت فکری میتوانند مرز روشنی میان «نوآوری»، «استفاده منصفانه» و «کپیبرداری از هوش مصنوعی» ترسیم کنند یا این نبرد نیز مانند پروندههای مربوط به آموزش مدلها، سالها در دادگاهها ادامه خواهد داشت.