arXiv:2608.20290ترجمه شده

User Safety: safe

Cheng Xu، Nan Yan، Liming Chen، M-Tahar Kechadi

چکیده

آیا یک مدل زبانی خود را بهبود داده است یا خیر؟ به طور تدریجی، این مدل بر اساس دقت متوسط عمل نمی‌کند؛ بلکه در مورد نحوه مواجهه با مسائل فردی و نقاط ضعف آن مشکل دارد. ردیابی این تغییرات به معنای تفریق دو برآورد نویزآمیز است که این امر آن‌ها را در معرض آرٹیفیکت‌های اندازه‌گیری قرار می‌دهد. ارزیابی سه دور rank-32 Dus-Rank (LoRA) خودآموزش‌خورده بر روی Q انجام شده است.

متن کامل

کد، داده و ابزارهای مرتبط با این مقاله تگ‌گذاری شده توسط arXiv (alphaXiv) هستند (alphaXiv چیست؟) پیوند به کد CatalyzeX - جستوگر کد دقیق برای مقالات (چیست CatalyzeX؟) تغییر DagsHub - تگ‌گذاری شده DagsHub (چیست DagsHub؟) تغییر GotitPub - تگ‌گذاری شده Gotit.pub (چیست GotitPub؟) تغییر Hugging Face - تگ‌گذاری شده Hugging Face (چیست Hugging Face؟) تغییر ScienceCast - تگ‌گذاری شده ScienceCast (چیست ScienceCast؟) دموها - تگ‌گذاری شده Replicate (چیست Replicate؟) فضای‌ها - تگ‌گذاری شده Hugging Face Spaces (چیست Spaces؟) TXYZ.AI - تگ‌گذاری شده TXYZ.AI (چیست TXYZ.AI؟) مقالات مرتبط - دستورالعمل‌های توصیه‌کننده و ابزارهای جستجو با لینک به Influence Flower (چه هستند گل‌های Influence؟) پیشنهاددهندگان مقاله این مقاله کی هستند؟ غیرفعال کردن MathJax (چیست MathJax؟) ارتباطات کلی پژوهش‌ها و دستورالعمل‌های توصیه‌کننده و ابزارهای جستجو لینک به Influence Flower پیشنهاددهنده‌های پایه توصیه‌کننده CORE (چیست CORE؟) منبع نویسنده موسسه موضوع درباره arXivLabs arXivLabs - پروژه‌های آزمایشی با همکاران جامعه arXiv با این ارزش‌ها متعهد است و تنها با شرکتی که آن‌ها را دنبال می‌کند کار می‌کند ایده‌ای برای پروژه که ارزش برای جامعه arXiv ایجاد کند؟ بیشتر درباره arXivLabs یاد بگیرید. کدام نویسندگان این مقاله پشتیبانی می‌کنند؟ غیرفعال کردن MathJax (چیست MathJax؟)