جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 رونمایی گوگل از مدل اختصاصی رباتیک Gemini Robotics ER 2

رونمایی گوگل از مدل اختصاصی رباتیک Gemini Robotics ER 2

زمان مطالعه: 5 دقیقه

مدل Gemini Robotics ER 2 نشان‌دهنده یک جهش گام‌به‌گام در توانمندسازی ربات‌ها از طریق درک ویدئویی، ارکستراسیون وظایف و همکاری میان‌رباتی است؛ امری که امکان نقش‌آفرینی کارآمدتر ربات‌ها را در جهان فیزیکی فراهم می‌کند.

برای‌آنکه ربات‌ها بتوانند به انسان‌ها در محیط‌های روزمره کمک کنند، تنها استدلال فضایی (Spatial Reasoning) دقیق کافی نیست. ربات‌ها باید سریع فکر کنند، تصمیم‌گیری‌های خود را زمان‌بندی نمایند و همگام با سرعت لحظه‌ای (Real-time) دنیای فیزیکی استدلال کنند. ازاین‌رو، گوگل مدل Gemini Robotics ER 2 را توسعه داده است؛ توانمندترین مدل «استدلال تجسّم‌یافته» (Embodied Reasoning) گوگل در حوزه رباتیک.

Gemini Robotics ER 2 چیست؟

می‌توانید Gemini Robotics ER 2 را به‌عنوان یک مغز سطح‌بالا (High-level Brain) برای ربات‌ها در نظر بگیرید. این مدل به ربات‌ها اجازه می‌دهد با انسان‌ها گفت‌وگو کنند، جهان فیزیکی را درک کنند و وظایف چندمرحله‌ای را برنامه‌ریزی کنند. همچنین این مدل اجرای حرکتی (Motor Execution) را به هر مدل سطح‌پایین‌تر بینایی-زبان-عمل (Vision-Language-Action / VLA) واگذار می‌کند. مدل Gemini Robotics ER 2 همچنین به‌صورت بومی (Native) می‌تواند ابزارهایی مانند سرچ گوگل یا هر تابع تعریف‌شده دیگری از سوی کاربر را برای یافتن اطلاعات فراخوانی کند. معماری Gemini Robotics ER 2 به ربات این امکان را می‌دهد که هم‌زمان با اجرای اقدامات خود، درباره مرحله بعدی «فکر» کند.

مدل Gemini Robotics ER 2 ارتقای چشمگیری نسبت به نسخه Gemini Robotics ER 1.6 محسوب می‌شود. ربات‌ها اکنون با تحلیل جریان‌های ویدئویی پیوسته می‌توانند پیشرفت کار خود را پایش کنند، در صورت بروز خطا با شرایط منطبق شوند و دقیقاً بدانند چه زمانی باید به مرحله بعدی بروند. گوگل همچنین قابلیت «همکاری میان‌رباتی» (Multi-robot Collaboration) را معرفی کرده که ربات‌ها را قادر می‌سازد در فضاهای مشترک با یکدیگر همکاری کرده و جریان‌های کاری پیچیده‌ای را که یک ربات به‌تنهایی قادر به انجام آن‌ها نیست، به پایان برسانند.

مدل Gemini Robotics ER 2 هم‌اکنون از طریق  Gemini APIو Google AI Studioدر دسترس عموم توسعه‌دهندگان قرار دارد و پیش‌نمایش اختصاصی آن نیز روی پلتفرم Gemini Enterprise Agent Platform ارائه شده است. برای شروع کار، گوگل نمونه‌هایی از نحوه پیکربندی مدل و پرامپت‌نویسی برای توانمندسازی وظایف کاربردی‌ترِ هوش مصنوعی فیزیکی (Physical AI) را به اشتراک می‌گذاشته است.

ارتقای قابلیت‌های عاملیت فیزیکی

اکثر وظایف در دنیای فیزیکی پیچیده هستند و برای تکمیل به مراحل متعدد نیاز دارند. مدل Gemini Robotics ER 2 یک عامل فیزیکی (Physical Agent) است که مراحل را برای ربات ارکستراسیون (هماهنگ‌سازی) کرده، امکان اصلاح خودکار را فراهم می‌سازد و قابلیت تعمیم‌پذیری به موقعیت‌های جدیدتر را ایجاد می‌کند. برای راه‌اندازی یک ساختار عامل‌محور، توسعه‌دهندگان می‌توانند رابط‌های کنترلی سطح‌پایین مانند مدل‌های VLA یا APIهای ناوبری را به‌عنوان ابزار تعریف کنند و جریان‌های چندرسانه‌ای ویدئو، صوت یا متن را به‌صورت مستقیم به مدل ارسال نمایند.

مدل Gemini Robotics ER 2 در ارکستراسیون ابزارها، در هر سه حالت کنترلی (VLA واقعی، VLA شبیه‌سازی‌شده، و هدایت از راه دور توسط انسان)، عملکرد بهتری از نسخه ER 1.6 دارد.

در حوزه رباتیک، استدلال سطح‌بالا وابسته به‌سرعت اجرا است. مدل Gemini Robotics ER 2 با Gemini Live API ادغام می‌شود و از یک نقطه پایانی استریم دوطرفه که برای وظایف حساس به تأخیر بهینه‌سازی شده، استفاده می‌کند. نتیجه این امر، یک ارکستراسیون روان است. Gemini Robotics ER 2 مدل‌های عملیاتی و APIهای رباتیک را بدون توقف‌های ناگهانی برای «فکرکردن»، جهت تکمیل وظایف چندمرحله‌ای فرماندهی می‌کند.

برای نمایش این قابلیت، یک دمو با ربات Spot از شرکت Boston Dynamics ساخته شده است. گوگل از Gemini Robotics ER 2 برای ارکستراسیون APIهای Spot، نظیر ناوبری و حرکت بازوی مکانیکی استفاده کرده تا رباتی تعاملی ایجاد کند که با دریافت فرمان به زبان طبیعی، اشیا را جابه‌جا کند.

کد این پروژه به همراه نمونه‌های دیگر در گیت‌هاب در دسترس است.

هوش زمانی برای تکمیل مستحکم وظایف

یکی از سخت‌ترین چالش‌ها در رباتیک، تشخیص زمان دقیق پایان یک وظیفه است. مدل Gemini Robotics ER 2 جهشی گام‌به‌گام در درک ویدئویی و پایش پیشرفت به ارمغان می‌آورد تا تأیید کند وظایف پیچیده؛ مانند محکم کردن یک لامپ یا گره‌زدن کیسه‌زباله، پیش از رفتن به وظیفه بعدی، دقیقاً طبق مشخصات تعیین‌شده به پایان رسیده‌اند. در این به‌روزرسانی، گوگل در دو قابلیت بنیادین برای درک پیشرفت وظایف به پیشرفت‌های مهمی دست یافته است.

طبقه‌بندی پیوسته پیشرفت (Continuous Progress Classification)

طبقه‌بندی پیشرفت به توانایی ربات در پایش روند تکمیل یک وظیفه اشاره دارد. در ارزیابی‌های گوگل، هر فریم از یک جریان ویدئویی در یکی از ۵ سطح پیشرفت (۰-۲۰٪، ۲۰-۴۰٪، ۴۰-۶۰٪، ۶۰-۸۰٪، ۸۰-۱۰۰٪) قرار می‌گیرد. با کمی‌سازی پیشرفت وظایف، Gemini Robotics ER 2 آگاهی موقعیتی آنی (Real-time Situational Awareness) را برای ربات‌ها فراهم می‌کند و به آن‌ها اجازه می‌دهد اقدامات خود را در حین کار تنظیم کرده یا مراحل ناموفق را بدون نیاز به راه‌اندازی مجدد کل جریان کاری، دوباره امتحان کنند.

مدل Gemini Robotics ER 2 به‌دقت ۵۷.۴ درصدی در وظایف طبقه‌بندی پیشرفت دست یافته است که برتر از مدل‌های نسل قبل و مدل‌های پیشرو (Frontier Models) رقیب است.

لحظه‌یابی دقیق (Precision Moment-finding)

لحظه‌یابی، توانایی مدل را در شناسایی فریم دقیق ویدئویی که یک رویداد بحرانی در آن رخ می‌دهد (مثلاً زمان دقیق توقف ریختن قهوه در فنجان) می‌سنجد. مدل Gemini Robotics ER 2 به جهش بالایی در عملکرد لحظه‌یابی دست یافته است که ربات‌ها را قادر می‌سازد به طور دقیق بین وظایف سوئیچ کنند، موفقیت عملیات را تأیید کنند و اصلاحات لازم را پیشنهاد دهند.

در وظایف لحظه‌یابی، Gemini Robotics ER 2 به‌دقت ۹۱.۳ درصد و میانگین فاصله مطلق (Mean Absolute Distance) ۰.۹۶ ثانیه دست یافته است. این مدل با رده‌های مدلی بسیار بزرگ‌تر رقابت نزدیکی دارد، اما این دقت را با کسری از هزینه پردازشی و ۴ برابر سرعت اجرای بیشتر ارائه می‌دهد؛ تأخیری زیر یک ثانیه که برای عملکرد ایمن رباتیک فیزیکی در دنیای واقعی الزامی است.

همکاری میان‌رباتی (Multi-robot Collaboration)

هیچ ربات به‌تنهایی برای تمامی وظایف مناسب نیست؛ یک کاوشگر چرخ‌دار در محیط‌های داخلی عالی عمل می‌کند، درحالی‌که یک ربات انسان‌نما ممکن است در زمین‌های ناهموار برتری داشته باشد. مدل Gemini Robotics 2 همکاری میان‌رباتی را ممکن می‌سازد و به ماشین‌های گوناگون اجازه می‌دهد از طریق یک درک معنایی مشترک (Shared Semantic Understanding) با یکدیگر ارتباط برقرار کرده، کارها را دست‌به‌دست کنند و وظایف پیچیده را به پایان برسانند.

همکاری میان Apollo 2 و Franka F3 Duo به کمک Gemini Robotics ER 2 را از اینجا ببینید.

ارتقای هوش فضایی عمومی (General Spatial Intelligence)

مدل Gemini Robotics ER 2 قابلیت‌های پایه استدلال فضایی گوگل را ارتقا می‌دهد، همان‌طور که توسط سه بنچمارک زیر اندازه‌گیری شده است:

  • تشخیص موفقیت/شکست (Success/failure detection): اکنون به‌جای عکس‌های ایستا، روی جریان‌های ویدئویی خام عمل می‌کند تا خطاهای حین اجرا مانند ریختن مایعات، سرخوردن یا عدم تراز را شناسایی کند.
  • خواندن ابزارآلات عمومی (General instrument reading): از درجه‌های دایره‌ای و شیشه‌های بازدید فراتر رفته و نمایشگرهای دیجیتال، مقیاس‌های خطی، خط‌کش‌ها و دماسنج‌های مایع را شامل می‌شود. گوگل این موضوع را روی ۱۰ نوع ابزار مختلف آزمایش کرده است.
  • پرسش‌وپاسخ دیداری-فضایی ارتقایافته (Enhanced spatial VQA): پرسش‌وپاسخ دیداری را از طریق پیشرفت‌های Gemini در درک چندرسانه‌ای بهبود می‌بخشد.
مدل Gemini Robotics ER 2 به بالاترین دقت در تمامی قابلیت‌های پایه دست یافته است، از جمله در تشخیص موفقیت (تصویر/ویدئو)، پرسش‌وپاسخ (ERQA) و خواندن تعمیم‌یافته ابزارآلات.

ارتقای ایمنی برای هوش تجسّم‌یافته (Embodied Intelligence)

مدل Gemini Robotics ER 2 ایمن‌ترین مدل گوگل است که به پیشرفت‌های چشمگیری در بنچمارک‌های «پیروی از دستورالعمل‌های ایمنی» (Safety Instruction Following) و «مجاورت با انسان» (Human Proximity) دست یافته است؛ بنچمارک‌هایی که نحوه پایبندی مدل به محدودیت‌های فیزیکی هنگام استدلال و آگاهی فضایی برای تشخیص انسان‌ها را ارزیابی می‌کنند. در آزمایش‌های گوگل مشخص شد که Gemini Robotics ER 2 هنگام نزدیک‌شدن یک فرد، ربات انسان‌نما را با موفقیت متوقف می‌کند و تنها زمانی که منطقه خالی از خطر شد، کار را به‌صورت خودمختار از سر می‌گیرد.

برای ارتقای ایمنی عاملیت‌های فیزیکی، گوگل بنچمارکی را معرفی می‌کند که توانایی یک مدل پایه را به‌عنوان ارکستراتور ایمنِ VLA ارزیابی می‌کند؛ این کار از طریق سنجش ظرفیت مدل در اعمال محدودیت‌های ایمنی، پایش محیط، ارزیابی امکان‌پذیری فیزیکی و درخواست شفاف‌سازی از انسان انجام می‌شود.

مدل Gemini Robotics ER 2 در بنچمارک‌های پیروی از دستورالعمل‌های ایمنی و مجاورت با انسان، نسبت به ER 1.6 و سایر مدل‌های پیشرو برتری دارد.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]