گام بزرگ گوگل برای خودکفایی در زیستبوم هوش مصنوعی
معرفی نسل هشتم TPUهای گوگل؛ تراشههایی برای عصر عاملمحور
تراشههای TPU 8t و TPU 8i، محصول نهایی یک دهه توسعه که به طور اختصاصی و سفارشی برای تأمین قدرت نسل بعدی ابررایانش با کارایی بالا و مقیاسپذیری مهندسی شدهاند.
غول فناوری گوگل در رویداد Google Cloud Next که از ۲۲ تا ۲۴ آوریل در لاسوگاس برگزار شد؛ از نسل هشتم «واحد پردازش تانسور» (TPU) خود رونمایی کرد. نسل هشتم TPUهای گوگل بهزودی با دو معماری متمایز و هدفمند برای آموزش و استنتاج هوش مصنوعی عرضه خواهد شد.
معرفی
TPUهای معرفی و طراحیشده توسط گوگل سالهاست که منبع اصلی قدرت و توان پردازشی مدلهای بنیادین پیشرو از جمله Gemini هستند. نسل هشتم تراشههای جدید گوگل در دو نوع با نامهای TPU 8t و TPU 8i اختصاصاً برای تأمین قدرت پردازشی ابررایانههای سفارشی گوگل طراحی شدهاند تا همه وظایف لازم از آموزش مدلهای پیشرفته و توسعه عاملها گرفته تا بارهای کاری عظیم استنتاج را انجام دهند. این TPUهای نسل هشتم در کنار یکدیگر، مقیاسپذیری، کارایی و قابلیتهای لازم در حوزههای آموزش، ارائه خدمات و بارهای کاری عاملمحور در عصر هوش مصنوعی و هوش مصنوعی عاملمحور را فراهم خواهند کرد.
در عصر عاملهای هوش مصنوعی، مدلها باید در مورد مسائل استدلال کنند، گردش کارهای چندمرحلهای را اجرا کنند و در چرخههایی پیوسته از اقدامات خود بیاموزند. این امر مجموعهای از الزامات جدید را بر زیرساختها تحمیل میکند. TPU 8t و TPU 8i با همکاری Google DeepMind طراحی شدهاند تا از عهده طاقتفرساترین بارهای کاری هوش مصنوعی برآیند و با معماریهای مدل در حال تحول در مقیاس بزرگ سازگار شوند.
TPUها تاکنون استانداردهایی را برای تعدادی از اجزای ابررایانش یادگیری ماشین از جمله محاسبات عددی سفارشی (custom numerics)، خنکسازی مایع، اتصالات داخلی سفارشی (custom interconnects) و موارد دیگر تعیین کردهاند و TPUهای نسل هشتم گوگل محصول نهایی بیش از یک دهه توسعه هستند.
دو تراشه برای پاسخ به نیازهای کنونی
چرخههای توسعه سختافزار بسیار طولانیتر از نرمافزار است. با هر نسل از TPUها، باید در نظر بگیریم که در زمان عرضه آنها به بازار، چه فناوریها و تقاضاهایی وجود خواهد داشت. گوگل چندین سال پیش، افزایش تقاضا برای استنتاج از سوی مشتریان خود را با استقرار مدلهای هوش مصنوعی پیشگام در مقیاس تولید، پیشبینی کرد و با ظهور عاملهای هوش مصنوعی، به این نتیجه رسید که برای دستیابی به بهترین نتایج میبایست از تراشههایی که به طور جداگانه برای نیازهای آموزش و ارائه خدمات بهینهسازی شدهاند استفاده کرد.
پردازنده TPU 8t برای بارهای کاری آموزشی عظیم و نیازمند محاسبات سنگین با توان پردازشی بالاتر و پهنای باند لازم برای افزایش مقیاسپذیری بیشتر طراحی شده است. پردازنده TPU 8i نیز با پهنای باند حافظه بیشتر برای ارائه خدمات به حساسترین بارهای کاری استنتاج که نسبت به تأخیر حساس هستند طراحی شده است که امری حیاتی است؛ زیرا تعاملات بین عاملها در مقیاس بزرگ، حتی کوچکترین ناکارآمدیها را نیز تشدید میکند.
نکته مهم این است که هر دو تراشه میتوانند بارهای کاری مختلفی را اجرا کنند، اما این بهینهسازی تخصصی، کارایی و دستاوردهای قابلتوجهی را به ارمغان میآورد.
TPU 8t: نیروگاه آموزش
TPU 8t ساخته شده است تا چرخه توسعه مدلهای پیشگام را از ماهها به هفتهها کاهش دهد. با ایجاد توازن بین بالاترین توان پردازشی ممکن، حافظه مشترک و پهنای باند بینتراشهای با بهترین بهرهوری انرژی و زمان محاسباتی مولد، گوگل سیستمی ساخته که تقریباً ۳ برابر عملکرد محاسباتی بیشتری بهازای هر پاد (pod) نسبت به نسل قبل ارائه میدهد.
- مقیاس عظیم: یک سوپرپاد تکی TPU 8t اکنون تا ۹۶۰۰ تراشه و دو پتابایت حافظه مشترک با پهنای باند بالا قابلیت مقیاسپذیری دارد و پهنای باند بینتراشهای آن دو برابر نسل قبل است. این معماری ۱۲۱ اگزافلاپس (ExaFlops) توان محاسباتی ارائه میدهد و به پیچیدهترین مدلها اجازه میدهد تا از یک استخر حافظه عظیم و یکپارچه بهرهمند شوند.
- حداکثر بهرهبرداری: با یکپارچهسازی دسترسی ۱۰ برابر سریعتر به حافظه ذخیرهسازی همراه با TPUDirect برای هدایت مستقیم دادهها به درون TPU، تراشه TPU 8t به تضمین حداکثر بهرهبرداری از کل سیستم کمک میکند.
- مقیاسپذیری تقریباً خطی: شبکه Virgo گوگل، در ترکیب با JAX و نرمافزار Pathways، به TPU 8t امکان مقیاسپذیری تقریباً خطی را برای حداکثر یک میلیون تراشه در یک خوشه منطق واحد فراهم میکند.
علاوه بر عملکرد خام، TPU 8t مهندسی شده است تا از طریق مجموعهای جامع از قابلیتهای پایایی، دسترسپذیری و خدمتپذیری (RAS)، به بیش از ۹۷ درصد «گذردهی مفید» (goodput) که معیاری برای زمان محاسباتی مفید و مولد است دست یابد. این قابلیتها شامل تلهمتری آنی در دهها هزار تراشه، تشخیص خودکار و مسیریابی مجدد حول پیوندهای ICI معیوب بدون ایجاد وقفه در کار و سوئیچینگ مدار نوری (OCS) است که سختافزار را در هنگام بروز خطا بدون دخالت انسان مجدداً پیکربندی میکند.
هر خرابی سختافزاری، توقف شبکه یا راهاندازی مجدد از روی نقطه بازرسی زمانی انجام میشود که خوشه در حال آموزش نیست و در مقیاس آموزش مدلهای پیشگام، هر درصد میتواند به معنای روزها زمان آموزش فعال باشد.

TPU 8i: موتور استدلال
در عصر عاملمحور، کاربران انتظار دارند بتوانند سؤال بپرسند، وظایف را محول کنند و به نتیجه برسند. TPU 8i برای مدیریت کارهای پیچیده، تعاملی و تکرارشونده بسیاری از عاملهای تخصصی طراحی شده است که اغلب بهصورت «ازدحامی» (swarming) در جریانهای کاری پیچیده با هم کار میکنند تا برای چالشبرانگیزترین وظایف، راهحل و بینش ارائه دهند. گوگل این ساختار و پشته (stack) فناوری را با چهار نوآوری کلیدی بازطراحی کرده تا اثر «اتاق انتظار» (waiting room) را حذف کند.
- فراتر از Memory Wall: برای جلوگیری از بیدارماندن پردازندهها، TPU 8i مقدار ۲۸۸ گیگابایت حافظه با پهنای باند بالا را با ۳۸۴ مگابایت SRAM روی تراشه که ۳ برابر بیشتر از نسل قبلی است جفت میکند تا مجموعه کاری فعال یک مدل به طور کامل روی تراشه باقی بماند.
- کارایی مبتنی بر Axion: گوگل هاستهای فیزیکی CPU در هر سرور را دو برابر کرده و به پردازندههای سفارشی Axion مبتنی بر Arm خود روی آورده است. با استفاده از معماری حافظه غیریکنواخت (NUMA) برای جداسازی، کل سیستم را برای عملکردی برتر بهینهسازی کرده است.
- مقیاسپذیری مدلهای MoE: برای مدلهای مدرن «ترکیب از خبرگان» (Mixture of Expert)، گوگل پهنای باند اتصال متقابل (ICI) را دو برابر کرده تا ۱۹.۲ترابیت بر ثانیه افزایش داده است. معماری جدید گوگل به نام Boardfly، حداکثر قطر شبکه را بیش از ۵۰ درصد کاهش میدهد و اطمینان حاصل میکند که سیستم بهعنوان یک واحد منسجم و با تأخیر کم کار میکند.
- حذف لگ و تأخیر: موتور جدید شتابدهنده عملیات جمعی روی تراشه (CAE)، بار عملیات سراسری را از دوش پردازنده برمیدارد که تأخیر روی تراشه را تا ۵ برابر کاهش داده و کندی را به حداقل میرساند.
این نوآوریها نسبت به نسل قبلی، ۸۰ درصد عملکرد بهتر بهازای هر یک دلار هزینهکرد ارائه میدهند و به کسبوکارها این امکان را میدهند که تقریباً دو برابر حجم مشتریان را با همان هزینه پشتیبانی کنند.

طراحی مشترک برای Gemini و در دسترس برای همه
هشتمین نسل TPU، جدیدترین نمود از فلسفه طراحی مشترک گوگل است، جایی که هر مشخصه برای حل بزرگترین موانع هوش مصنوعی ساخته شده است.
- توپولوژی Boardfly به طور خاص برای نیازهای ارتباطی توانمندترین مدلهای استدلالی امروزی طراحی شده است.
- ظرفیت SRAM در TPU8i متناسب با ردپای حافظه پنهان و کش KV در مدلهای استدلالی در مقیاس محیط تولید اندازهگیری شده است.
- اهداف پهنای باند بستر شبکه Virgo از الزامات موازیسازی برای آموزش مدلهای تریلیون پارامتری استخراج شده است.
همچنین برای اولینبار است که هر دو تراشه روی هاستهای CPU مبتنی بر ARM اختصاصی گوگل یعنی Axion اجرا میشوند که به گوگل اجازه میدهد کل سیستم و نهفقط تراشه را برای عملکرد و کارایی بهینهسازی کنیم.
هر دو پلتفرم از فریمورکهای بومی JAX، MaxText، PyTorch، SGLangو vLLM (فریمورکهایی که توسعهدهندگان در حال حاضر از آنها استفاده میکنند) پشتیبانی و امکان دسترسی به سرورهای برمتال (Bare Metal) را فراهم میکند که به کاربران دسترسی مستقیم به سختافزار را بدون هزینهکرد و فرایندهای سربار مجازیسازی را میدهد.

طراحی برای بهرهوری انرژی در مقیاس بالا
در دیتاسنترهای امروزی، توان مصرفی و نهفقط تأمین تراشه، یک محدودیت الزامآور است. گوگل برای حل این مشکل، سطح عملکرد را در سراسر پشته فناوری، با مدیریت یکپارچه توان که به طور پویا مصرف برق را بر اساس تقاضای در لحظه تنظیم میکند، بهینهسازی کرده است. تراشههای TPU8t و TPU8i نسبت به نسل قبلی خود یعنی Ironwood، تا ۲برابر عملکرد بهتری بهازای هر وات (performance-per-watt) ارائه میدهند.
علاوه بر این، گوگل اتصال شبکه را با محاسبات روی یک تراشه ادغام کرده و هزینههای مصرف انرژی برای جابهجایی داده در سراسر پاد TPU را به میزان قابلتوجهی کاهش داده است. نوآوریهای گوگل در سختافزار و نرمافزار دیتاسنترهایش میتوانند تا ۶ برابر بیشتر از پنج سال پیش، قدرت محاسباتی بهازای هر واحد برق ارائه دهند. TPU8tو TPU8i ادامهدهنده این مسیر هستند؛ بهطوری که هر دوی این تراشهها توسط فناوری خنککننده مایع (liquid cooling) نسل چهارم گوگل پشتیبانی میشوند که چگالی عملکردی را که خنککننده بادی قادر به تحمل آن نیست را ارائه میکند.

زیرساخت برای عصر عاملمحور
هر گذار عمده محاسباتی نیازمند پیشرفتهای اساسی در زیرساخت بوده است و عصر عاملمحور نیز از این قاعده مستثنی نیست. زیرساخت باید تکامل یابد تا پاسخگوی نیازهای عاملهای خودمختاری باشد که در حلقههای پیوسته استدلال، برنامهریزی، اجرا و یادگیری عمل میکنند.
پردازندههای نسل هشتم TPU8t و TPU8i، پاسخ گوگل به این چالش هستند؛ دو معماری تخصصی که ساخته شدهاند تا مرزهای امکانپذیری در هوش مصنوعی را بازتعریف کنند، از ساخت توانمندترین مدلهای هوش مصنوعی گرفته تا هماهنگسازی بینقص تجمع عاملها و مدیریت پیچیدهترین وظایف استدلالی. هر دو تراشه اواخر سال جاری میلادی در دسترس عموم قرار خواهند گرفت و بهعنوان بخشی از ابررایانه هوش مصنوعی گوگل (AI Hypercomputer) استفاده میشوند که سختافزار تخصصی (محاسبات، ذخیرهسازی، شبکه)، نرمافزار باز (فریمورکها، موتورهای استنتاج) و مصرف منعطف (هماهنگسازی، مدیریت کلاستر و مدلهای تحویل) را در یک پشته یکپارچه گرد هم میآورد.