Kelvin Li، Dhruv Pendharkar، Anish Pahilajani، Chuyi Shang و 5 نفر دیگر
وبسایتهای اخیر برای انتخاب عمل در زمان تست با نمونهبرداری از اقدامات نامزد، پیشبینی وضعیتهای وب حاصل و رتبهبندی آنها از طریق مدلهای رتبهبند یا مدل پاداش فرآیندی (PRM) استفاده میکنند. این مدلهای جهانی معمولاً ا…
رباتهای خودکاری که با یادگیری عمیق تغذیه میشوند، با چالش بنیادی قابلیت بازبینی مواجهاند: هنگام وقوع حوادث، محققان قادر به بازسازی دلایل تصمیمات خاص اتخاذشده توسط سیستم نیستند. این مقاله چارچوب تریاسیک (TRACE — معماری…
Aleksander Ficek، Sean Narenthiran، Mehrzad Samadi، Somshubra Majumdar و 1 نفر دیگر
Competitive programming has become a key test of large language model reasoning, with international competitions such as IOI and ICPC representing its most challenging settings. We present an end-to-end specialization pi…
Hao Zhou، Mandar Kulkarni، Hao Chen، Yan Xin و 2 نفر دیگر
تحلیل علت ریشهای (RCA) یک وظیفهٔ حیاتی در عملیات شبکههای مخابراتی است، اما شناسایی افتهای عملکردی در شبکههای مدرن ۵G و شبکههای نوظهور ۶G بهدلیل وابستگیهای پیچیدهٔ بینلایهای همچنان چالشبرانگیز باقی مانده است. مد…
به مدت بیش از ۲۰ سال، نمونه مرجع Model-RB (frb100-40) یک چالش باز باقی مانده بود؛ از سال ۲۰۱۴، رکورد عمومی آن ۹۹ از ۱۰۰ متغیر بوده است. ما یک مجموعه مستقل ۱۰۰-رأسی قابل بررسی مستقیم برای گراف ۴٬۰۰۰-رأسی آن ارائه میدهیم.…
مردم بهطور روزافزونی از مدلهای زبانی برای پشتیبانی از تصمیمگیری در زندگی استفاده میکنند. بسیاری از این تصمیمات مستلزم پیشبینی احتمالاتی هستند: احتمال وقوع یک رویداد مهم زندگی، یک بلای طبیعی، یا یک نتیجه اقتصادی چقدر…
Qinghua Mao، Wanying Qu، Dadi Guo، Leitao Yuan و 7 نفر دیگر
عملکرد عاملهای مبتنی بر مدلهای زبانی بزرگ (LLM) از تعامل همزمان مدل پایه و چارچوب اجرایی در محیط نشأت میگیرد. این ویژگی آنها را در برابر آسیبهای ایمنی آسیبپذیر میسازد؛ چه در پاسخهای نهایی مضر و چه در مسیرهای اجر…
Kefeng Duan، Dewu Zheng، Yanlin Wang، Xiwen Wang و 6 نفر دیگر
ارزیابی عوامل مهندسی نرمافزار بر روی بنچمارکهای واقعی، هزینهبر است؛ زیرا هر وظیفه ممکن است نیازمند کاوش چندمرحلهای کد، اصلاح آن و اجرای آزمون باشد. روشهای ارزیابی کارآمد موجود، زیرمجموعههایی نمادین را برای برآورد ع…
Kefeng Duan، Dewu Zheng، Yanlin Wang، Terry Yue Zhuo و 7 نفر دیگر
در زمینه تولید کد در سطح پایگاه داده، کارگاههای واقعی اغلب از رویکردهای مبتنی بر تولید تقویتشده با بازیابی (Retrieval-Augmented Generation) (RAG) برای فراهم کردن زمینهای مختص پایگاه داده بهره میبرند. اگرچه این روشها…