arXiv:2609.10522ترجمه شده

Show-Harness: فقط یک عامل VLM می‌تواند نقش ربات‌ها را بازی کند

Yanzhe Chen، Zechen Bai، Zhijun Cao، Wenzheng Zeng، Kevin Qinghong Lin، Yiqi Lin، Guoqiang Liang، Kevin Yuchen Ma، Qiming Huang، Mike Zheng Shou

چکیده

مدل‌های پایهٔ بینایی‌ـ‌زبان (VLMs) دانش گسترده‌ای درباره جهان از خود نشان می‌دهند؛ بااین‌حال، تبدیل این دانش به کنترل روبوت همچنان چالشی دشوار است. ما Show-Harness را معرفی می‌کنیم؛ نمونه‌ای از Harness جسمانی (Embodied Harness) که به VLM‌ها امکان می‌دهد روبوت‌ها را از طریق رابطی معنایی و فشرده «بازی» کنند و این رابط، قصد را به عمل پیوند می‌دهد. Show-Harness واحدهای گسستهٔ عمل معنایی ارائه می‌کند که VLM‌ها می‌توانند به‌طور طبیعی با آن‌ها استدلال کنند؛ در عین حال، مفسرهای اختصاصیِ هر جسمانی‌سازی (embodiment) این واحدها را به‌صورت قطعی به اقدامات محلی روبوت تبدیل می‌کنند و VLM را مستقیماً مسئول تصمیم‌های فیزیکی ریزدانه نگه می‌دارد. از طریق همین رابط، Show-Harness امکان‌پذیریِ (1) به‌کارگیری مستقیم مدل‌های VLM پیشرفته و بسته برای کنترل روبوت بدون نمونه (zero-shot)، و (2) تطبیق مدل‌های VLM منبع‌باز کوچک‌مقیاس برای مستقرسازی کم‌هزینه، صرفاً با چند ساعت GPU برای تنظیم دقیق (fine-tuning)، را نشان می‌دهد. ما همچنین GUMI (GUI Manipulation Interface) را توسعه می‌دهیم که فضای عمل معنایی مشابه را به جمع‌آوری داده‌های مبتنی بر GUI گسترش می‌دهد و به انسان‌ها و عامل‌ها (agents) امکان می‌دهد روبوت‌ها را در جسمانی‌های مختلف، بدون سخت‌افزار تله‌کنترل تخصصی، «بازی» کنند. آزمایش‌های گسترده نشان می‌دهند که نماینده‌های VLM مجهز به Show-Harness در میان وظایف، جسمانی‌ها و محیط‌ها تعمیم‌پذیری پایدار از خود نشان می‌دهند و الگوهای عامل‌محور و VLA را از نظر عملکرد پشت سر می‌گذارند. این نتایج نشان می‌دهند که یک رابط مناسب می‌تواند توانایی جسمانی‌سازی قابل‌توجهی را در مدل‌های VLM پایه آزاد کند، بدون نیاز به افزایش ظرفیت مدل یا آموزش پیشین پرهزینه و اختصاصی به جسمانی‌سازی.

متن کامل

عنوان: Show-Harness: مجرد یک عامل VLM می‌تواند ربات‌ها را «بازی» کند نویسندگان: Yanzhe Chen, Zechen Bai, Zhijun Cao, Wenzheng Zeng, Kevin Qinghong Lin, Yiqi Lin, Guoqiang Liang, Kevin Yuchen Ma, Qiming Huang, Mike Zheng Shou چکیده: مدل‌های بینایی-زبانی پایه (VLM) هوشمندی گسترده‌ای در جهان نشان می‌دهند، اما تبدیل این هوش به کنترل ربات چالش‌برانگیز باقی مانده است. در اینجا Show-Harness را معرفی می‌کنیم؛ یک سیستم incarnated که به VLMs قدرت می‌بخشد تا از طریق یک رابط سمتی کompakt که نیت را به عمل متصل می‌کند، ربات‌ها را «بازی» کند. Show-Harness واحد‌های عملکردی سمتی را که VLMs می‌توانند به‌طور طبیعی بر آن‌ها استدلال کنند، آشکار می‌سازد؛ در حالی که مفسرهای incarnated آن‌ها را به‌طور deterministic به اقدامات رباتی محلی پیوند می‌دهند و VLM مستقیماً مسئول تصمیمات فیزیکی دقیق می‌شود. از طریق همان رابط، Show-Harness امکان‌پذیری را فراهم می‌آورد تا (۱) مستقیماً VLMs پیشرو و بسته را برای کنترل ربات zero-shot باز کند، و (۲) VLMs بسته پیشرو کوچک‌مقیاس را برای استقرار با هزینه کم تنظیم نماید. علاوه بر این، GUMI (GUI Manipulation Interface) را توسعه می‌دهیم که فضای عملکردی سمتی مشترک را برای جمع‌آوری نمونه‌های نمایش GUI مبتنی بر انسان گسترش می‌دهد؛ به‌طوری که انسان‌ها و عوامل می‌توانند ربات‌ها را در emboditions مختلف بدون نیاز به سخت‌افزار teloperation تخصصی «بازی» کنند. آزمایش‌های گسترده نشان می‌دهد که عامل‌های VLM مجهز به Show-Harness در اجرای Tasks، emboditions و محیط‌ها تعمیم‌یاب قوی نشان می‌دهند و پارادایم‌های نماینده‌ی Agent و VLA را فراتر از حد معمول قرار می‌دهند. این نتایج نشان می‌دهد که رابط مناسب می‌تواند توانایی incarnated قابل توجهی را از VLMs پایه باز کند، بدون نیاز به ظرفیت مدل اضافی یا pre-training incarnated هزینه‌بر. توضیحات: موضوعات: Robotics (cs.RO); Artificial Intelligence (cs.AI); Computer Vision and Pattern Recognition (cs.CV); Multimedia (cs.MM) استناد به: arXiv:2609.10522 [cs.RO] (یا arXiv:2609.10522v1 [cs.RO] برای این نسخه) https://doi.org/10.48550/arXiv.2609.10522 تاریخ ارسال: از: Yanzhe Chen [مشاهده ایمیل] [v1] پنج‌شنبه، ۹ سپتامبر ۲۰۲۶ ۱۷:۵۳:۳۸ UTC (۸,۰۳۲ KB) ابزارهای بایوگرافی: ابزارهای بایوگرافی و استخبار کاوشگر بایوگرافی پیوند به کاوشگر بایوگرافی (کاوشگر بایوگرافی چیست؟) مطالب مرتبط پیوند به مطالب مرتبط (مطالب مرتبط چیست؟) Litmaps پیوند به Litmaps (Litmaps چیست؟) scite.ai پیوند به scite Smart Citations (Smart Citations چیست؟) کد، داده، رسانه کد، داده و رسانه مرتبط با این مقاله alphaXiv پیوند به alphaXiv (alphaXiv چیست؟) پیوند به کد پیوند به CatalyzeX Code Finder برای مقالات (CatalyzeX Code Finder برای مقالات چیست؟) DagsHub پیوند به DagsHub (DagsHub چیست؟) GotitPub پیوند به Gotit.pub (Gotit.pub چیست؟) Hugging Face پیوند به Hugging Face (Hugging Face چیست؟) ScienceCast پیوند به ScienceCast (ScienceCast چیست؟)