arXiv:2609.01567ترجمه شده

راهنمایی انتخابی عامل از طریق آنتروپی: یادگیری سیاست‌های خودمختار از معلم‌های ناقص VLM

Matteo Merler، Giovanni Bonetta، Davide Zago، Rossella Cancelliere، Bernardo Magnini

چکیده

متأسفانه متنی برای ویرایش ارائه نشده است. لطفاً متن فارسی مورد نظر خود را که مایل به بهبود ترجمه آن هستید، ارسال کنید تا بتوانم ویرایش‌های لازم را انجام دهم.

متن کامل

علوم کامپیوتر > هوش مصنوعی arXiv:2609.01567v1 (cs) [ارسال شده در ۱ سپتامبر ۲۰۲۶] **عنوان:** راهنمایی انتخابی عامل از طریق آنتروپی: یادگیری سیاست‌های خودمختار از معلمان VLM ناقص **نویسندگان:** ماتئو مرلر، جووانی بونتا، داویده زاگو، روزلا کانچلیه‌ره، برناردو مانینی مشاهده PDF مقاله‌ای با عنوان «راهنمایی انتخابی عامل از طریق آنتروپی: یادگیری سیاست‌های خودمختار از معلمان VLM ناقص»، توسط ماتئو مرلر و ۴ نویسنده دیگر مشاهده PDF HTML (آزمایشی) **چکیده:** مدل‌های زبانی-بینایی (VLMs) پیش‌نیازهای مفیدی برای تصمیم‌گیری تعاملی فراهم می‌کنند، اما استفاده مستقیم از آنها به عنوان سیاست، پرهزینه و شکننده است: آنها باید در هر مرحله پرس‌وجو شوند، از تعامل با محیط بهبود نمی‌یابند، و ممکن است خطاهای سیستماتیک را تکرار کنند. در این مقاله، بررسی می‌کنیم که چگونه می‌توان یک سیاست خودمختار و کم‌هزینه را از یک معلم VLM آنلاین، پرهزینه، ناقص، اما آموزنده آموخت. ما SAGE (راهنمایی انتخابی عامل از طریق آنتروپی) را پیشنهاد می‌کنیم؛ چارچوبی که تنها زمانی از VLM پرس‌وجو می‌کند که یادگیرنده دچار عدم قطعیت باشد، در طول آموزش اقدام پیشنهادی را اجرا می‌کند، و راهنمایی را در یک سیاست سبک مبتنی بر یادگیری تقویتی (RL) تقطیر می‌کند. از آنجا که توصیه‌های VLM همیشه قابل اعتماد نیستند، SAGE می‌تواند با استفاده از مزیت‌های مشتق‌شده از محیط، تقطیر اقدام معلم را وزن‌دهی کند، به‌جای آنکه همه پیشنهادات را به یک اندازه مفید بداند. در وظایف استدلال بینایی و ناوبری با پاداش تنک، SAGE سیاست‌هایی می‌آموزد که در زمان ارزیابی بدون راهنمایی VLM عمل می‌کنند و در چندین محیط نسبت به RL بدون راهنمایی بهبود می‌یابند؛ از جمله در تنظیماتی که سیاست آموخته‌شده از خود معلم VLM نیز فراتر می‌رود. نتایج نشان می‌دهد که راهنمایی انتخابی زمانی بیشترین سودمندی را دارد که VLM بتواند به عامل کمک کند تا مسیرهای با پاداش بالا را کشف کند، و زمانی کمتر مفید است که اکتشاف بدون راهنمایی از پیش موفق باشد یا اقدامات معلم به تجربه آموزنده منجر نشود. SAGE همچنین استفاده از VLM را با پرس‌وجو از معلم تنها در کسری از مراحل آموزش کاهش می‌دهد و در زمان استقرار به هیچ تماسی با VLM نیاز ندارد. در مجموع، یافته‌های ما نشان می‌دهد که VLMها برای مفید بودن نیازی به استفاده به عنوان سیاست‌های ثابت ندارند؛ بلکه می‌توانند به‌عنوان منابع راهنمایی موقت و ناقص عمل کنند که ارزش آنها از طریق تعامل آزمایشی و درونی‌سازی حاصل می‌شود. **توضیحات:** **موضوعات:** هوش مصنوعی (cs.AI)؛ محاسبات و زبان (cs.CL)؛ یادگیری ماشین (cs.LG) **نحوه استناد:** arXiv:2609.01567 [cs.AI] (یا arXiv:2609.01567v1 [cs.AI] برای این نسخه) https://doi.org/10.48550/arXiv.2609.01567 برای اطلاعات بیشتر درباره DOI صادرشده توسط arXiv از طریق DataCite (در انتظار ثبت) مراجعه کنید. **مرجع مجله:** یافته‌های EMNLP 2026 **تاریخچه ارسال:** **از:** ماتئو مرلر [مشاهده ایمیل] **[v1]** سه‌شنبه، ۱ سپتامبر ۲۰۲۶، ۱۷:۳۳:۴۱ UTC (۱,۹۳۹ KB) **ابزارهای کتاب‌شناختی** ابزارهای کتاب‌شناختی و استنادی کاوشگر کتاب‌شناختی تغییر وضعیت کاوشگر کتاب‌شناختی (کاوشگر چیست؟) مقالات مرتبط تغییر وضعیت مقالات مرتبط (مقالات مرتبط چیست؟) نقشه‌های ادبیات تغییر وضعیت نقشه‌های ادبیات (نقشه‌های ادبیات چیست؟) scite.ai تغییر وضعیت استنادهای هوشمند scite (استنادهای هوشمند چیست؟) **کد، داده، رسانه** کد، داده و رسانه‌های مرتبط با این مقاله alphaXiv تغییر وضعیت alphaXiv (alphaXiv چیست؟) لینک‌ها به کد | نمایش کلید | یافتن‌کننده کد CatalyzeX برای مقالات (CatalyzeX چیست؟) DagsHub | نمایش کلید | GotitPub (GotitPub چیست؟) Huggingface | نمایش کلید | ScienceCast (ScienceCast چیست؟) نمایش‌ها | نمایش کلید Replicate (Replicate چیست؟) Spaces | نمایش کلید Hugging Face Spaces | نمایش کلید TXYZ.AI (TXYZ.AI چیست؟) مقالات مرتبط سامانه‌های پیشنهاددهنده و ابزارهای جستجو | لینک به Influence Flower Influence Flower (گل‌های تأثیرگذار چیست؟) سامانه پیشنهاددهنده CORE | نمایش کلید (CORE چیست؟) نویسنده | مجله | مؤسسه | موضوع درباره arXivLabs arXivLabs: پروژه‌های آزمایشی با همکاران جامعه arXivLabs چارچوبی است که به همکاران امکان می‌دهد ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه داده و به اشتراک بگذارند. هم افراد و هم سازمان‌هایی که با arXivLabs کار می‌کنند، ارزش‌های باز بودن، جامعه‌محوری، برتری و حریم خصوصی داده‌های کاربران ما را پذیرفته‌اند. arXiv به این ارزش‌ها متعهد است و تنها با شرکایی که آن‌ها را رعایت می‌کنند همکاری می‌کند. آیا ایده‌ای برای پروژه‌ای دارید که ارزش افزوده‌ای برای جامعه arXiv داشته باشد؟ درباره arXivLabs بیشتر بدانید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال‌سازی MathJax (MathJax چیست؟)