Jiarui Yan، Weiwei Sun، Sijie Li، Wenhan Li و 1 نفر دیگر
Large language models write correct code for isolated problems but remain far weaker at autonomous machine-learning development, where an agent must revise data pipelines, models, and validation over hours of feedback, a…
Roshan Prakash Rane، Marco Simnacher، Manuel Pfeuffer، Marc-Andre Schulz و 6 نفر دیگر
شبکههای عصبی عمیق اغلب از ارتباطات جعلی در دادههای آموزشی خود بهره میبرند؛ نقصی که با نام یادگیری میانبر شناخته میشود. روشهای تبیینپذیری مبتنی بر مفهوم، برای شناسایی این میانبرها، با بررسی این پرسش عمل میکنند که آ…
تفسیر نادرست قصد در طول تعاملات خودرو، به شکستهای مکرر برنامهریزی منجر میشود. ما یک لایهٔ تصمیمگیری را بررسی میکنیم که در آن یک ماژول قصد هدایتشونده با زبان، توصیفگرهای ساختاریافته را میخواند، یک امتیاز واگرایی ه…
Niklas Muennighoff، Zhengyang Wang، Zeyi Chen، Weijia Shi و 14 نفر دیگر
مقیاسدهی در زمان آزمون (test-time scaling) با بهرهگیری از محاسبات اضافی در زمان آزمون، عملکرد مدل را بهبود میبخشد؛ برای نمونه، به مدلهای زبانی اجازه میدهد هنگام حل یک مسئله، استدلال طولانیتری داشته باشند. از آنجا ک…
Zhaochen Yu، Yingcheng Wu، Zhenfei Yin، Kaiyuan Chen و 4 نفر دیگر
بهبود خود‑بازگشتی (RSI) در وظایف افقطولانی دشوار میماند؛ جایی که سابقههای رشدگی وضعیت وظیفه را مبهم میسازند و فراخوانی مهارت را نامتناسب میکنند. ما Recuris را معرفی میکنیم، یک معماری حافظه تجربی‑کار بازگشتی برای وظ…
Kai Ruan، Jinghao Lin، Qianshan Wei، Ziqi Zhou و 1 نفر دیگر
یادگیری تقویتی نسبی به گروه، منتظر بازپخشهای همزاد یکسان از یک پیام میماند که برای مسیرهای ابزی طولانی و هزینهبر متغیر است. بهینهسازی سیاست تکجریانی (SPO) با حذف این وابستگی، با استفاده از یک برآورد ارزش سطحی از پیا…
Andreas Hochlehnert، Marianna Nezhurina، Mehdi Cherti، Andrej Radonjic و 8 نفر دیگر
We present LAION-BVD, a large-scale open video dataset for multimodal learning, which contains 1.3B platform-specific video URLs collected from CommonCrawl. From these, we download 80M videos with a total duration of 10…