نسخه جدیدی از TPU این شرکت برای پرسوجو از مدلها بهینهسازی شده است
گوگل تراشه هوش مصنوعی ویژه «استنتاج» عرضه میکند
گوگل رقابت برای توسعه سریعترین و کارآمدترین تراشههای هوش مصنوعی جهان را وارد مرحله تازهای کرده است.
واحد آلفابت، یک پردازنده رایانهای جدید توسعه داده که برای نوعی از عملیات محاسباتی سفارشیسازی شده است که در پرسوجو از مدلهای هوش مصنوعی به کار میرود، نه در آموزش آنها. تقاضا برای این نوع پردازش که «استنتاج» نام دارد، با استقبال کسبوکارها از عاملهای هوش مصنوعیِ قادر به نوشتن نرمافزار و انجام وظایف دیگر، بهسرعت در حال افزایش است.
این شرکت قصد دارد این هفته در رویدادی شرکتی در لاسوگاس، نسل هشتم «واحدهای پردازش تنسور» یا TPUهای خود را رونمایی کند.
«بازار استنتاج دستکم هماندازه بازار آموزش خواهد شد، اگر از آن بزرگتر نباشد.»
به گفته افرادی آگاه از موضوع، گوگل چندین سال است که روی یک تراشه ویژه استنتاج کار میکند و در ماههای اخیر نیز گروه کوچکی از شرکتهای هوش مصنوعی را برای آزمایش توانمندیهای این تراشه به کار گرفته است. گوگل همچنین در حال معرفی یک تراشه جداگانه است که برای آموزش بهینهسازی شده است؛ فرایندی که در آن به مدلهای هوش مصنوعی دیتا داده میشود و به آنها یاد میدهند چگونه به پرسوجوها پاسخ دهند.
«توماس کوریان»، مدیرعامل واحد رایانش ابری گوگل گفت: «اگر استنتاج نداشته باشید، نمیتوانید هزینه آموزش را پوشش دهید. بنابراین در نهایت بازار استنتاج دستکم هماندازه بازار آموزش خواهد شد، اگر از آن بزرگتر نباشد.»
این تحول رقابت میان کسبوکار نیمهرساناهای سفارشی گوگل و انویدیا، رهبر بازار، را شدیدتر میکند؛ آن هم در شرایطی که گسترش استفاده از هوش مصنوعی عاملمحور، موجی از تقاضا برای تراشههای سریعتر و کممصرفتر از نظر انرژی ایجاد کرده است.
این غول تراشهسازی ماه گذشته راهکار استنتاجی خود را نیز معرفی کرد؛ یک سرور متشکل از واحدهای پردازش گرافیکی مشهورش، یا GPUها، که با تراشههای استارتاپ Groq جفت شدهاند؛ شرکتی که انویدیا سال گذشته در قالب قراردادی ۲۰ میلیارد دلاری، فناوری آن را تحت لیسانس گرفت.
یکی دیگر از استارتاپهای حوزه تراشه که بر استنتاج تمرکز دارد، یعنی Cerebras، اخیراً با Amazon Web Services قراردادی بزرگ امضا کرده تا توان پردازشی سریعتری را برای اجرای مدلهای شرکتهای هوش مصنوعی فراهم کند.
Cerebras هفته گذشته برای عرضه عمومی سهام اقدام کرد و قصد دارد عرضه اولیه سهام خود را در سریعترین حالت از اواسط ماه مه آغاز کند. انویدیا با فروش میلیونها GPU به مشتریان بزرگی چون OpenAI، مایکروسافت و اوراکل، به بزرگترین شرکت بورسی جهان تبدیل شد.
GPUها با وجود سرعت و توان پردازشی بالای خود، و با اینکه میتوانند تا مرتبه کوادریلیونها کار ساده را بهطور همزمان انجام دهند، بیش از همه برای آموزش مدلها مفید هستند.
چالش دیوار حافظه
استنتاج به توان خام پردازشی کمتری نسبت به چیزی که GPUها معمولاً فراهم میکنند نیاز دارد، اما در عوض به حافظه بیشتری احتیاج دارد. بدون حافظه کافی، مشتریانی که حجم زیادی پرسوجو یا عامل هوش مصنوعی را اجرا میکنند، ممکن است به «دیوار حافظه» برخورد کنند؛ یعنی گلوگاهی که وقتی یک تراشه نمیتواند به اندازه کافی سریع به دادهها دسترسی پیدا کند ایجاد میشود و کاربران را وادار میکند برای پاسخ مدلها مدت بیشتری منتظر بمانند.
«مارک لوهمایر»، معاون هوش مصنوعی و زیرساخت محاسباتی در Google Cloud، گفت: «آنچه واقعاً برای مشتریان اهمیت دارد این است که چگونه میتوان تأخیر را کاهش داد»، اشارهای به مدت زمانی که طول میکشد تا یک مدل پاسخ تولید کند.
لوهمایر گفت هر درخواست به یک عامل هوش مصنوعی، نسبت به یک پرسوجوی معمولی از یک چتبات، بین ۲۰ تا ۵۰ برابر «تراکنش استنتاج» بیشتری ایجاد میکند؛ زیرا عامل، بهجای صرفاً تولید یک پاسخ، خودش بهطور مستقل اقدامات متعددی را انجام میدهد.
ناظران صنعت سالهاست این پرسش را مطرح کردهاند که آیا گوگل TPUهای خود را برای استفاده گسترده تجاری عرضه خواهد کرد یا نه. این شرکت تاکنون دو قرارداد مهم با بازیگران بیرونی امضا کرده است؛ یکی برای دادن دسترسی به حدود یک میلیون تراشه به Anthropic، سازنده Claude، و دیگری با Meta Platforms.
گوگل اواخر سال گذشته «امین وحدت»، یکی از مهندسان ارشد خود، را از سمت معاون زیرساخت هوش مصنوعی در واحد Cloud به سمتی جدید با عنوان مدیر ارشد فناوری زیرساخت هوش مصنوعی ارتقا داد؛ سمتی که در آن مستقیماً به «ساندار پیچای»، مدیرعامل آلفابت، گزارش میدهد.
وحدت در نقش جدید خود بر کسبوکار TPU و نیز توسعه نسلهای جدید Gemini و دیگر مدلهای هوش مصنوعی نظارت دارد.