رونمایی گوگل از مدل اختصاصی رباتیک Gemini Robotics ER 2
مدل Gemini Robotics ER 2 نشاندهنده یک جهش گامبهگام در توانمندسازی رباتها از طریق درک ویدئویی، ارکستراسیون وظایف و همکاری میانرباتی است؛ امری که امکان نقشآفرینی کارآمدتر رباتها را در جهان فیزیکی فراهم میکند.
برایآنکه رباتها بتوانند به انسانها در محیطهای روزمره کمک کنند، تنها استدلال فضایی (Spatial Reasoning) دقیق کافی نیست. رباتها باید سریع فکر کنند، تصمیمگیریهای خود را زمانبندی نمایند و همگام با سرعت لحظهای (Real-time) دنیای فیزیکی استدلال کنند. ازاینرو، گوگل مدل Gemini Robotics ER 2 را توسعه داده است؛ توانمندترین مدل «استدلال تجسّمیافته» (Embodied Reasoning) گوگل در حوزه رباتیک.
Gemini Robotics ER 2 چیست؟
میتوانید Gemini Robotics ER 2 را بهعنوان یک مغز سطحبالا (High-level Brain) برای رباتها در نظر بگیرید. این مدل به رباتها اجازه میدهد با انسانها گفتوگو کنند، جهان فیزیکی را درک کنند و وظایف چندمرحلهای را برنامهریزی کنند. همچنین این مدل اجرای حرکتی (Motor Execution) را به هر مدل سطحپایینتر بینایی-زبان-عمل (Vision-Language-Action / VLA) واگذار میکند. مدل Gemini Robotics ER 2 همچنین بهصورت بومی (Native) میتواند ابزارهایی مانند سرچ گوگل یا هر تابع تعریفشده دیگری از سوی کاربر را برای یافتن اطلاعات فراخوانی کند. معماری Gemini Robotics ER 2 به ربات این امکان را میدهد که همزمان با اجرای اقدامات خود، درباره مرحله بعدی «فکر» کند.
مدل Gemini Robotics ER 2 ارتقای چشمگیری نسبت به نسخه Gemini Robotics ER 1.6 محسوب میشود. رباتها اکنون با تحلیل جریانهای ویدئویی پیوسته میتوانند پیشرفت کار خود را پایش کنند، در صورت بروز خطا با شرایط منطبق شوند و دقیقاً بدانند چه زمانی باید به مرحله بعدی بروند. گوگل همچنین قابلیت «همکاری میانرباتی» (Multi-robot Collaboration) را معرفی کرده که رباتها را قادر میسازد در فضاهای مشترک با یکدیگر همکاری کرده و جریانهای کاری پیچیدهای را که یک ربات بهتنهایی قادر به انجام آنها نیست، به پایان برسانند.
مدل Gemini Robotics ER 2 هماکنون از طریق Gemini APIو Google AI Studioدر دسترس عموم توسعهدهندگان قرار دارد و پیشنمایش اختصاصی آن نیز روی پلتفرم Gemini Enterprise Agent Platform ارائه شده است. برای شروع کار، گوگل نمونههایی از نحوه پیکربندی مدل و پرامپتنویسی برای توانمندسازی وظایف کاربردیترِ هوش مصنوعی فیزیکی (Physical AI) را به اشتراک میگذاشته است.
ارتقای قابلیتهای عاملیت فیزیکی
اکثر وظایف در دنیای فیزیکی پیچیده هستند و برای تکمیل به مراحل متعدد نیاز دارند. مدل Gemini Robotics ER 2 یک عامل فیزیکی (Physical Agent) است که مراحل را برای ربات ارکستراسیون (هماهنگسازی) کرده، امکان اصلاح خودکار را فراهم میسازد و قابلیت تعمیمپذیری به موقعیتهای جدیدتر را ایجاد میکند. برای راهاندازی یک ساختار عاملمحور، توسعهدهندگان میتوانند رابطهای کنترلی سطحپایین مانند مدلهای VLA یا APIهای ناوبری را بهعنوان ابزار تعریف کنند و جریانهای چندرسانهای ویدئو، صوت یا متن را بهصورت مستقیم به مدل ارسال نمایند.

در حوزه رباتیک، استدلال سطحبالا وابسته بهسرعت اجرا است. مدل Gemini Robotics ER 2 با Gemini Live API ادغام میشود و از یک نقطه پایانی استریم دوطرفه که برای وظایف حساس به تأخیر بهینهسازی شده، استفاده میکند. نتیجه این امر، یک ارکستراسیون روان است. Gemini Robotics ER 2 مدلهای عملیاتی و APIهای رباتیک را بدون توقفهای ناگهانی برای «فکرکردن»، جهت تکمیل وظایف چندمرحلهای فرماندهی میکند.
برای نمایش این قابلیت، یک دمو با ربات Spot از شرکت Boston Dynamics ساخته شده است. گوگل از Gemini Robotics ER 2 برای ارکستراسیون APIهای Spot، نظیر ناوبری و حرکت بازوی مکانیکی استفاده کرده تا رباتی تعاملی ایجاد کند که با دریافت فرمان به زبان طبیعی، اشیا را جابهجا کند.
کد این پروژه به همراه نمونههای دیگر در گیتهاب در دسترس است.
هوش زمانی برای تکمیل مستحکم وظایف
یکی از سختترین چالشها در رباتیک، تشخیص زمان دقیق پایان یک وظیفه است. مدل Gemini Robotics ER 2 جهشی گامبهگام در درک ویدئویی و پایش پیشرفت به ارمغان میآورد تا تأیید کند وظایف پیچیده؛ مانند محکم کردن یک لامپ یا گرهزدن کیسهزباله، پیش از رفتن به وظیفه بعدی، دقیقاً طبق مشخصات تعیینشده به پایان رسیدهاند. در این بهروزرسانی، گوگل در دو قابلیت بنیادین برای درک پیشرفت وظایف به پیشرفتهای مهمی دست یافته است.
طبقهبندی پیوسته پیشرفت (Continuous Progress Classification)
طبقهبندی پیشرفت به توانایی ربات در پایش روند تکمیل یک وظیفه اشاره دارد. در ارزیابیهای گوگل، هر فریم از یک جریان ویدئویی در یکی از ۵ سطح پیشرفت (۰-۲۰٪، ۲۰-۴۰٪، ۴۰-۶۰٪، ۶۰-۸۰٪، ۸۰-۱۰۰٪) قرار میگیرد. با کمیسازی پیشرفت وظایف، Gemini Robotics ER 2 آگاهی موقعیتی آنی (Real-time Situational Awareness) را برای رباتها فراهم میکند و به آنها اجازه میدهد اقدامات خود را در حین کار تنظیم کرده یا مراحل ناموفق را بدون نیاز به راهاندازی مجدد کل جریان کاری، دوباره امتحان کنند.

لحظهیابی دقیق (Precision Moment-finding)
لحظهیابی، توانایی مدل را در شناسایی فریم دقیق ویدئویی که یک رویداد بحرانی در آن رخ میدهد (مثلاً زمان دقیق توقف ریختن قهوه در فنجان) میسنجد. مدل Gemini Robotics ER 2 به جهش بالایی در عملکرد لحظهیابی دست یافته است که رباتها را قادر میسازد به طور دقیق بین وظایف سوئیچ کنند، موفقیت عملیات را تأیید کنند و اصلاحات لازم را پیشنهاد دهند.

همکاری میانرباتی (Multi-robot Collaboration)
هیچ ربات بهتنهایی برای تمامی وظایف مناسب نیست؛ یک کاوشگر چرخدار در محیطهای داخلی عالی عمل میکند، درحالیکه یک ربات انساننما ممکن است در زمینهای ناهموار برتری داشته باشد. مدل Gemini Robotics 2 همکاری میانرباتی را ممکن میسازد و به ماشینهای گوناگون اجازه میدهد از طریق یک درک معنایی مشترک (Shared Semantic Understanding) با یکدیگر ارتباط برقرار کرده، کارها را دستبهدست کنند و وظایف پیچیده را به پایان برسانند.
همکاری میان Apollo 2 و Franka F3 Duo به کمک Gemini Robotics ER 2 را از اینجا ببینید.
ارتقای هوش فضایی عمومی (General Spatial Intelligence)
مدل Gemini Robotics ER 2 قابلیتهای پایه استدلال فضایی گوگل را ارتقا میدهد، همانطور که توسط سه بنچمارک زیر اندازهگیری شده است:
- تشخیص موفقیت/شکست (Success/failure detection): اکنون بهجای عکسهای ایستا، روی جریانهای ویدئویی خام عمل میکند تا خطاهای حین اجرا مانند ریختن مایعات، سرخوردن یا عدم تراز را شناسایی کند.
- خواندن ابزارآلات عمومی (General instrument reading): از درجههای دایرهای و شیشههای بازدید فراتر رفته و نمایشگرهای دیجیتال، مقیاسهای خطی، خطکشها و دماسنجهای مایع را شامل میشود. گوگل این موضوع را روی ۱۰ نوع ابزار مختلف آزمایش کرده است.
- پرسشوپاسخ دیداری-فضایی ارتقایافته (Enhanced spatial VQA): پرسشوپاسخ دیداری را از طریق پیشرفتهای Gemini در درک چندرسانهای بهبود میبخشد.

ارتقای ایمنی برای هوش تجسّمیافته (Embodied Intelligence)
مدل Gemini Robotics ER 2 ایمنترین مدل گوگل است که به پیشرفتهای چشمگیری در بنچمارکهای «پیروی از دستورالعملهای ایمنی» (Safety Instruction Following) و «مجاورت با انسان» (Human Proximity) دست یافته است؛ بنچمارکهایی که نحوه پایبندی مدل به محدودیتهای فیزیکی هنگام استدلال و آگاهی فضایی برای تشخیص انسانها را ارزیابی میکنند. در آزمایشهای گوگل مشخص شد که Gemini Robotics ER 2 هنگام نزدیکشدن یک فرد، ربات انساننما را با موفقیت متوقف میکند و تنها زمانی که منطقه خالی از خطر شد، کار را بهصورت خودمختار از سر میگیرد.
برای ارتقای ایمنی عاملیتهای فیزیکی، گوگل بنچمارکی را معرفی میکند که توانایی یک مدل پایه را بهعنوان ارکستراتور ایمنِ VLA ارزیابی میکند؛ این کار از طریق سنجش ظرفیت مدل در اعمال محدودیتهای ایمنی، پایش محیط، ارزیابی امکانپذیری فیزیکی و درخواست شفافسازی از انسان انجام میشود.
