جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 معرفی نسل هشتم TPUهای گوگل؛ تراشه‌هایی برای عصر عامل‌محور

گام بزرگ گوگل برای خودکفایی در زیست‌بوم هوش مصنوعی

معرفی نسل هشتم TPUهای گوگل؛ تراشه‌هایی برای عصر عامل‌محور

زمان مطالعه: 6 دقیقه

تراشه‌های TPU 8t و TPU 8i، محصول نهایی یک دهه توسعه که به طور اختصاصی و سفارشی برای تأمین قدرت نسل بعدی ابررایانش با کارایی بالا و مقیاس‌پذیری مهندسی شده‌اند.

غول فناوری گوگل در رویداد Google Cloud Next که از ۲۲ تا ۲۴ آوریل در لاس‌وگاس برگزار شد؛ از نسل هشتم «واحد پردازش تانسور» (TPU) خود رونمایی کرد. نسل هشتم TPUهای گوگل به‌زودی با دو معماری متمایز و هدفمند برای آموزش و استنتاج هوش مصنوعی عرضه خواهد شد.

معرفی

TPUهای معرفی و طراحی‌شده توسط گوگل سال‌هاست که منبع اصلی قدرت و توان پردازشی مدل‌های بنیادین پیشرو از جمله Gemini هستند. نسل هشتم تراشه‌های جدید گوگل در دو نوع با نام‌های TPU 8t و TPU 8i اختصاصاً برای تأمین قدرت پردازشی ابررایانه‌های سفارشی گوگل طراحی شده‌اند تا همه وظایف لازم از آموزش مدل‌های پیشرفته و توسعه عامل‌ها گرفته تا بارهای کاری عظیم استنتاج را انجام دهند. این TPUهای نسل هشتم در کنار یکدیگر، مقیاس‌پذیری، کارایی و قابلیت‌های لازم در حوزه‌های آموزش، ارائه خدمات و بارهای کاری عامل‌محور در عصر هوش مصنوعی و هوش مصنوعی عامل‌محور را فراهم خواهند کرد.

در عصر عامل‌های هوش مصنوعی، مدل‌ها باید در مورد مسائل استدلال کنند، گردش کارهای چندمرحله‌ای را اجرا کنند و در چرخه‌هایی پیوسته از اقدامات خود بیاموزند. این امر مجموعه‌ای از الزامات جدید را بر زیرساخت‌ها تحمیل می‌کند. TPU 8t و TPU 8i با همکاری Google DeepMind طراحی شده‌اند تا از عهده طاقت‌فرساترین بارهای کاری هوش مصنوعی برآیند و با معماری‌های مدل در حال تحول در مقیاس بزرگ سازگار شوند.

TPUها تاکنون استانداردهایی را برای تعدادی از اجزای ابررایانش یادگیری ماشین از جمله محاسبات عددی سفارشی (custom numerics)، خنک‌سازی مایع، اتصالات داخلی سفارشی (custom interconnects) و موارد دیگر تعیین کرده‌اند و TPUهای نسل هشتم گوگل محصول نهایی بیش از یک دهه توسعه هستند.

دو تراشه برای پاسخ به نیازهای کنونی

چرخه‌های توسعه سخت‌افزار بسیار طولانی‌تر از نرم‌افزار است. با هر نسل از TPUها، باید در نظر بگیریم که در زمان عرضه آن‌ها به بازار، چه فناوری‌ها و تقاضاهایی وجود خواهد داشت. گوگل چندین سال پیش، افزایش تقاضا برای استنتاج از سوی مشتریان خود را با استقرار مدل‌های هوش مصنوعی پیشگام در مقیاس تولید، پیش‌بینی کرد و با ظهور عامل‌های هوش مصنوعی، به این نتیجه رسید که برای دستیابی به بهترین نتایج می‌بایست از تراشه‌هایی که به طور جداگانه برای نیازهای آموزش و ارائه خدمات بهینه‌سازی شده‌اند استفاده کرد.

پردازنده TPU 8t برای بارهای کاری آموزشی عظیم و نیازمند محاسبات سنگین با توان پردازشی بالاتر و پهنای باند لازم برای افزایش مقیاس‌پذیری بیشتر طراحی شده است. پردازنده TPU 8i نیز با پهنای باند حافظه بیشتر برای ارائه خدمات به حساس‌ترین بارهای کاری استنتاج که نسبت به تأخیر حساس هستند طراحی شده است که امری حیاتی است؛ زیرا تعاملات بین عامل‌ها در مقیاس بزرگ، حتی کوچک‌ترین ناکارآمدی‌ها را نیز تشدید می‌کند.

نکته مهم این است که هر دو تراشه می‌توانند بارهای کاری مختلفی را اجرا کنند، اما این بهینه‌سازی تخصصی، کارایی و دستاوردهای قابل‌توجهی را به ارمغان می‌آورد.

TPU 8t: نیروگاه آموزش

TPU 8t ساخته شده است تا چرخه توسعه مدل‌های پیشگام را از ماه‌ها به هفته‌ها کاهش دهد. با ایجاد توازن بین بالاترین توان پردازشی ممکن، حافظه مشترک و پهنای باند بین‌تراشه‌ای با بهترین بهره‌وری انرژی و زمان محاسباتی مولد، گوگل سیستمی ساخته که تقریباً ۳ برابر عملکرد محاسباتی بیشتری به‌ازای هر پاد (pod) نسبت به نسل قبل ارائه می‌دهد.

  • مقیاس عظیم: یک سوپرپاد تکی TPU 8t اکنون تا ۹۶۰۰ تراشه و دو پتابایت حافظه مشترک با پهنای باند بالا قابلیت مقیاس‌پذیری دارد و پهنای باند بین‌تراشه‌ای آن دو برابر نسل قبل است. این معماری ۱۲۱ اگزافلاپس (ExaFlops) توان محاسباتی ارائه می‌دهد و به پیچیده‌ترین مدل‌ها اجازه می‌دهد تا از یک استخر حافظه عظیم و یکپارچه بهره‌مند شوند.
  • حداکثر بهره‌برداری: با یکپارچه‌سازی دسترسی ۱۰ برابر سریع‌تر به حافظه ذخیره‌سازی همراه با TPUDirect برای هدایت مستقیم داده‌ها به درون TPU، تراشه TPU 8t به تضمین حداکثر بهره‌برداری از کل سیستم کمک می‌کند.
  • مقیاس‌پذیری تقریباً خطی: شبکه Virgo گوگل، در ترکیب با JAX و نرم‌افزار Pathways، به TPU 8t امکان مقیاس‌پذیری تقریباً خطی را برای حداکثر یک میلیون تراشه در یک خوشه منطق واحد فراهم می‌کند.

علاوه بر عملکرد خام، TPU 8t مهندسی شده است تا از طریق مجموعه‌ای جامع از قابلیت‌های پایایی، دسترس‌پذیری و خدمت‌پذیری (RAS)، به بیش از ۹۷ درصد «گذردهی مفید» (goodput) که معیاری برای زمان محاسباتی مفید و مولد است دست یابد. این قابلیت‌ها شامل تله‌متری آنی در ده‌ها هزار تراشه، تشخیص خودکار و مسیریابی مجدد حول پیوندهای ICI معیوب بدون ایجاد وقفه در کار و سوئیچینگ مدار نوری (OCS) است که سخت‌افزار را در هنگام بروز خطا بدون دخالت انسان مجدداً پیکربندی می‌کند.  

هر خرابی سخت‌افزاری، توقف شبکه یا راه‌اندازی مجدد از روی نقطه بازرسی زمانی انجام می‌شود که خوشه در حال آموزش نیست و در مقیاس آموزش مدل‌های پیشگام، هر درصد می‌تواند به معنای روزها زمان آموزش فعال باشد.

مقایسه Ironwood، نسل قبلی TPUهای گوگل با TPU 8t

TPU 8i: موتور استدلال

در عصر عامل‌محور، کاربران انتظار دارند بتوانند سؤال بپرسند، وظایف را محول کنند و به نتیجه برسند. TPU 8i برای مدیریت کارهای پیچیده، تعاملی و تکرارشونده بسیاری از عامل‌های تخصصی طراحی شده است که اغلب به‌صورت «ازدحامی» (swarming) در جریان‌های کاری پیچیده با هم کار می‌کنند تا برای چالش‌برانگیزترین وظایف، راه‌حل و بینش ارائه دهند. گوگل این ساختار و پشته (stack) فناوری را با چهار نوآوری کلیدی بازطراحی کرده تا اثر «اتاق انتظار» (waiting room) را حذف کند.

  • فراتر از Memory Wall: برای جلوگیری از بیدارماندن پردازنده‌ها، TPU 8i مقدار ۲۸۸ گیگابایت حافظه با پهنای باند بالا را با ۳۸۴ مگابایت SRAM روی تراشه که ۳ برابر بیشتر از نسل قبلی است جفت می‌کند تا مجموعه کاری فعال یک مدل به طور کامل روی تراشه باقی بماند.
  • کارایی مبتنی بر Axion: گوگل هاست‌های فیزیکی CPU در هر سرور را دو برابر کرده و به پردازنده‌های سفارشی Axion مبتنی بر Arm خود روی آورده است. با استفاده از معماری حافظه غیریکنواخت (NUMA) برای جداسازی، کل سیستم را برای عملکردی برتر بهینه‌سازی کرده است.
  • مقیاس‌پذیری مدل‌های MoE: برای مدل‌های مدرن «ترکیب از خبرگان» (Mixture of Expert)، گوگل پهنای باند اتصال متقابل (ICI) را دو برابر کرده تا ۱۹.۲ترابیت بر ثانیه افزایش داده است. معماری جدید گوگل به نام Boardfly، حداکثر قطر شبکه را بیش از ۵۰ درصد کاهش می‌دهد و اطمینان حاصل می‌کند که سیستم به‌عنوان یک واحد منسجم و با تأخیر کم کار می‌کند.
  • حذف لگ و تأخیر: موتور جدید شتاب‌دهنده عملیات جمعی روی تراشه (CAE)، بار عملیات سراسری را از دوش پردازنده برمی‌دارد که  تأخیر روی تراشه را تا ۵ برابر کاهش داده و کندی را به حداقل می‌رساند.

این نوآوری‌ها نسبت به نسل قبلی، ۸۰ درصد عملکرد بهتر به‌ازای هر یک دلار هزینه‌کرد ارائه می‌دهند و به کسب‌وکارها این امکان را می‌دهند که تقریباً دو برابر حجم مشتریان را با همان هزینه پشتیبانی کنند.

مقایسه Ironwood، نسل قبلی TPUهای گوگل با TPU 8i

طراحی مشترک برای Gemini و در دسترس برای همه

هشتمین نسل TPU، جدیدترین نمود از فلسفه طراحی مشترک گوگل است، جایی که هر مشخصه برای حل بزرگ‌ترین موانع هوش مصنوعی ساخته شده است.

  • توپولوژی Boardfly به طور خاص برای نیازهای ارتباطی توانمندترین مدل‌های استدلالی امروزی طراحی شده است.
  • ظرفیت SRAM در TPU8i متناسب با ردپای حافظه پنهان و کش KV در مدل‌های استدلالی در مقیاس محیط تولید اندازه‌گیری شده است.
  • اهداف پهنای باند بستر شبکه Virgo از الزامات موازی‌سازی برای آموزش مدل‌های تریلیون پارامتری استخراج شده است.

همچنین برای اولین‌بار است که هر دو تراشه روی هاست‌های CPU مبتنی بر ARM اختصاصی گوگل یعنی Axion اجرا می‌شوند که به گوگل اجازه می‌دهد کل سیستم و نه‌فقط تراشه را برای عملکرد و کارایی بهینه‌سازی کنیم.

هر دو پلتفرم از فریم‌ورک‌های بومی JAX، MaxText، PyTorch، SGLangو vLLM (فریم‌ورک‌هایی که توسعه‌دهندگان در حال حاضر از آن‌ها استفاده می‌کنند) پشتیبانی و امکان دسترسی به سرورهای برمتال (Bare Metal) را فراهم می‌کند که به کاربران دسترسی مستقیم به سخت‌افزار را بدون هزینه‌کرد و فرایندهای سربار مجازی‌سازی را می‌دهد.

توپولوژی سلسله‌مراتبی Boardfly در TPU8i از یک بلوک سازنده متشکل از ۴ تراشه کاملاً متصل به یک گروه کاملاً متصل متشکل از ۸ برد ساخته شده و ۳۶ عدد از چنین گروه‌هایی به طور کامل در یک پاد (pod) مدل TPU8iبه هم متصل می‌شوند.

طراحی برای بهره‌وری انرژی در مقیاس بالا

در دیتاسنترهای امروزی، توان مصرفی و نه‌فقط تأمین تراشه، یک محدودیت الزام‌آور است. گوگل برای حل این مشکل، سطح عملکرد را در سراسر پشته فناوری، با مدیریت یکپارچه توان که به طور پویا مصرف برق را بر اساس تقاضای در لحظه تنظیم می‌کند، بهینه‌سازی کرده است. تراشه‌های TPU8t و TPU8i نسبت به نسل قبلی خود یعنی Ironwood، تا ۲برابر عملکرد بهتری به‌ازای هر وات (performance-per-watt) ارائه می‌دهند.

علاوه بر این، گوگل اتصال شبکه را با محاسبات روی یک تراشه ادغام کرده و هزینه‌های مصرف انرژی برای جابه‌جایی داده در سراسر پاد TPU را به میزان قابل‌توجهی کاهش داده است. نوآوری‌های گوگل در سخت‌افزار و نرم‌افزار دیتاسنترهایش می‌توانند تا ۶ برابر بیشتر از پنج سال پیش، قدرت محاسباتی به‌ازای هر واحد برق ارائه دهند. TPU8tو TPU8i ادامه‌دهنده این مسیر هستند؛ به‌طوری که هر دوی این تراشه‌ها توسط فناوری خنک‌کننده مایع (liquid cooling) نسل چهارم گوگل پشتیبانی می‌شوند که چگالی عملکردی را که خنک‌کننده بادی قادر به تحمل آن نیست را ارائه می‌کند.

واحد توزیع خنک‌کننده نسل چهارم گوگل

زیرساخت برای عصر عامل‌محور

هر گذار عمده محاسباتی نیازمند پیشرفت‌های اساسی در زیرساخت بوده است و عصر عامل‌محور نیز از این قاعده مستثنی نیست. زیرساخت باید تکامل یابد تا پاسخگوی نیازهای عامل‌های خودمختاری باشد که در حلقه‌های پیوسته استدلال، برنامه‌ریزی، اجرا و یادگیری عمل می‌کنند.

پردازنده‌های نسل هشتم TPU8t و TPU8i، پاسخ گوگل به این چالش هستند؛ دو معماری تخصصی که ساخته شده‌اند تا مرزهای امکان‌پذیری در هوش مصنوعی را بازتعریف کنند، از ساخت توانمندترین مدل‌های هوش مصنوعی گرفته تا هماهنگ‌سازی بی‌نقص تجمع عامل‌ها و مدیریت پیچیده‌ترین وظایف استدلالی. هر دو تراشه اواخر سال جاری میلادی در دسترس عموم قرار خواهند گرفت و به‌عنوان بخشی از ابررایانه هوش مصنوعی گوگل (AI Hypercomputer) استفاده می‌شوند که سخت‌افزار تخصصی (محاسبات، ذخیره‌سازی، شبکه)، نرم‌افزار باز (فریم‌ورک‌ها، موتورهای استنتاج) و مصرف منعطف (هماهنگ‌سازی، مدیریت کلاستر و مدل‌های تحویل) را در یک پشته یکپارچه گرد هم می‌آورد.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]