چکیده
وبسایتهای اخیر برای انتخاب عمل در زمان تست با نمونهبرداری از اقدامات نامزد، پیشبینی وضعیتهای وب حاصل و رتبهبندی آنها از طریق مدلهای رتبهبند یا مدل پاداش فرآیندی (PRM) استفاده میکنند. این مدلهای جهانی معمولاً از طریق یادگیری نظارتشده برای پیشبینی وضعیت بعدی آموزش داده میشوند تا نمایهای ثابتی مانند اسنپشاتهای HTML یا AXTree تولید کنند. با این حال، دستیابی به رتبهبندی نهایی با وضعیتهای پیشبینیشده همراستا نیست؛ زیرا به نمایهای متمایز بین اقدامات مختلف برای ارزیابی دقیق وضعیت واقعی نیاز داریم. برای حل این مشکل، ما مفهوم هماهنگی وضعیت پیشبینیشده را تعریف میکنیم، که یک هدف آموزشی است که در آن نمایشگر پیشبینیشده باید وضعیت واقعی را با وضعیتهای حاصل از اقدامات جایگزین مقایسه کند. ما این مدلها را با استفاده از یک مجموعه داده شاخهدار وبسایتی آموزش میدهیم که از مسیرهای WebArena Go-Browse استخراج شده است، و در هر نقطه تصمیم، اقدامات جایگزین متعدد و وضعیتهای حاصل از آنها وجود دارد. نتایج آزمایشهای ما بر روی بنچمارک هماهنگی وضعیت پیشبینیشده نشان میدهد که رویکرد ما عملکرد بهتری نسبت به مدلهای جهانی آموزشدیده با پیشبینی وضعیت بعدی نظارتشده دارد. همچنین، نشان میدهیم که رویکرد ما رتبهبندی اقدامات سبک PRM را در WebPRMBench نسبت به PRMهای صرفاً اقدامی و PRMهای تقویتشده با مدلهای جهانی پیشبینی وضعیت نظارتشده بهبود میبخشد. در نهایت، در WebArena-Lite، با بهرهگیری از مدل جهانی ما برای انتخاب عمل در زمان تست، بهبود کلی در عملکرد وظیفه بهبود دست یافته است. صفحه پروژه ما در دسترس است: https://dhruvpendharkar.github.io/dwm/
متن کامل
عنوان: مدلهای جهانی تمایزدهنده (WM) برای عوامل وب
نویسندگان: Kelvin Li, Dhruv Pendharkar, Anish Pahilajani, Chuyi Shang, Leon Oks, Leonid Karlinsky, Rogerio Feris, Trevor Darrell, Roei Herzig
چکیده: عوامل وب اخیراً از مدلهای جهانی برای انتخاب عمل در زمان آزمون استفاده میکنند؛ بدین صورت که اقدامات کاندیدا را نمونهبرداری کرده، وضعیتهای وب حاصل را پیشبینی میکنند و سپس آنها را با استفاده از یک مدل رتبهبندی یا یک مدل پاداش فرآیندی (PRM) ارزیابی مینمایند. این مدلهای جهانی عموماً از طریق پیشبینی نظارتشدهی حالت بعدی بر روی نمایشهای ثابت مانند اسنپشاتهای HTML یا AXTree آموزش میبینند. با این حال، این تابع هدف با رتبهبندی downstream ناهمخوان است، زیرا آنچه برای امتیازدهی دقیق به آنها نیاز است این است که وضعیتهای پیشبینیشده بین کاندیداها تمایزپذیر باشند. برای رفع این مشکل، ما تابع هدف پیشبینی حالت تطبیقی را معرفی میکنیم؛ در این تابع هدف، نمایش پیشبینیشده باید حالت واقعی حاصل را از حالتهایی که توسط اقدامات جایگزین ایجاد میشوند، متمایز کند. ما این مدلها را با استفاده از یک مجموعه داده عامل وب شاخهای که از مسیرهای Go-Browse وبآرنا استخراج شده، آموزش میدهیم؛ در این مجموعه داده، هر نقطه تصمیم شامل چندین اقدام جایگزین و وضعیتهای حاصل آنها است. آزمایشها بر روی معیار تطبیقی پیشبینی حالت ما نشان میدهد که رویکرد ما نسبت به مدلهای جهانی که با پیشبینی نظارتشدهی حالت بعدی آموزش دیدهاند، برتری دارد. همچنین نشان میدهیم که رویکرد ما رتبهبندی عمل به سبک PRM را بر روی WebPRMBench بهبود میبخشد، در مقایسه با PRMهای صرفاً عملمحور و PRMهایی که با مدلهای جهانی پیشبینی نظارتشدهی حالت بعدی تقویت شدهاند. در نهایت، در WebArena-Lite، استفاده از مدل جهانی ما برای انتخاب عمل در زمان آزمون، موفقیت سراسری وظیفه را افزایش میدهد. صفحه پروژه ما در دسترس است: this https URL
موضوعات: هوش مصنوعی (cs.AI); یادگیری ماشین (cs.LG)
نحوه استناد: arXiv:2609.02885 [cs.AI] (یا arXiv:2609.02885v1 [cs.AI] برای این نسخه) https://doi.org/10.48550/arXiv.2609.02885