چکیده
User Safety: safe
متن کامل
# ریدیزاین تخلیق رویسیاستیک مدلهای زبانی بزرگ II: یک مثال آموزشی
**نویسندگان:** زیکوان فو، بینگشیانگ هو، یوکسین زوو، هائوهوان هوانگ، جینچیان ژانگ، روهانگ شیائو، چنگ چیان، چینیو لوو، هوآن-آنگ گائو، یودونگ وانگ، زهییوان لیو، نینگ دینگ، چائوجون شیائو
**چکیده:**
تخلیق رویسیاستیک (OPD) عملکردهای تولیدشده توسط دانشآموز را با نظارت توکنی سطحی از معلم ترکیب میکند. پژوهشهای قبلی عمدتاً رفتار الگوریتمی این فرآیند را بررسی کرده و نقش داده آموزشی را نامشخص گذاشتهاند. در این مقاله، این نقش را در حداقل داده بررسی میکنیم؛ یعنی آموزش با یک پرسش. OPD به صورت تکمرات برای صدها گام بهبود مییابد و بیشتر کسبوکار OPD دادهکامل را در حوزههای وظیفه و خانواده مدلها بازیابی میکند. نتایج این به شدت از طریق حالتهایی که در طول آموزش بازدید میشوند و نرخ همترازی دانشآموز با معلم توضیح داده میشود. ما «پوشش حالت» — نسبت حالتهایی که مجموعه پرسش به آنها میرسد به نسبت حالتهایی که دادهکامل OPD بازدید میکند — را اندازهگیری میکنیم. هر پرسش تنها ۷۱.۵٪ را پوشش میدهد، بیشتر آن در ۱۰۰ گام اول. افزودن پرسشهای معنایی متفاوت، پوشش و دقت اعتبارسنجی را همزمان بالا میبرد تا ۱۶ پرسش به ۹۸.۹٪ برسد و دادهکامل را مطابقسازی کند. با این حال، همترازی با سرعت مشابهی پیش میرود چه OPD روی یک پرسش و چه روی کل مجموعه آموزشی. حتی مجموعه ثابتی از حالتها نیز صدها گام برای جذب نیاز دارد. بنابراین OPD در دادهمحور اما نه در الگوریتمگرسنه عمل میکند. رولآوتهای آن نظارت گستردهای را سریع آشکار میکنند، در حالی که دانشآموز این نظارت را بهتدریج و بهآرامتر جذب میکند. نتیجه پوشش حالت به OPD چندمعلمی نیز گسترش مییابد؛ جایی که ۱۶ پرسش معنایی متنوع در هر حوزه، MOPD دادهکامل را مطابقسازی میکند. بهعنوان یک آزمون استرس بیشتر، الگوهای سبکمحتوا و پرسشهای وایلدچت خارج از حوزه نیز به خط پایه پرسش واقعی نزدیک میشوند. محتوای وظیفه و پوشش حالت قابل تفکیک بودهاند. امیدواریم این یافتهها کار آینده را به سمت کارایی گام OPD هدایت کنند و بازبررسی مکانیسمهای داده و موفقیتهای اخیر آن در آموزش پسین مرزی را تحریک نمایند.
**کلیدواژهها:** هوش مصنوعی (cs.AI)؛ زبانشناسی محاسباتی (cs.CL)
**یادداشت:** arXiv:2609.04172 [cs.AI] — ارسال شده در ۳ شهریور ۲۰۲۶
**مرتبط با این مقاله**
توییچ alphaXiv alphaXiv (alphaXiv چیست؟)
لینکهای کد توییچ CatalyzeX یابندهٔ کد برای مقالات (CatalyzeX چیست؟)
توییچ DagsHub DagsHub (DagsHub چیست؟)
توییچ Gotit.pub Gotit.pub (GotitPub چیست؟)
توییچ Hugging Face Hugging Face (Hugging Face چیست؟)
توییچ ScienceCast ScienceCast (ScienceCast چیست؟)
دیموهای دیمو توییچ Replicate Replicate (Replicate چیست؟)
توییچ Spaces Hugging Face Spaces (Spaces چیست؟)
توییچ Spaces TXYZ.AI (TXYZ.AI چیست؟)
مقالات مرتبط سیستمهای توصیه و جستجو
لینک به Influence Flower Influence Flower (Influence Flowers چیست؟)
توییچ سیستم توصیه CORE CORE Recommender (CORE چیست؟)
نویسنده مکان مؤسسة موضوع
دربارهٔ arXivLabs
arXivLabs: پروژههای آزمایشی با همکاران جامعه
arXivLabs یک چارچوب است که به همکاران اجازه میدهد ویژگیهای جدید arXiv را مستقیماً در وبسایت ما توسعه و به اشتراک بگذارند.
هر دو افراد و سازمانهایی که با arXivLabs همکاری دارند، ارزشهای ما از جمله باز بودن، جامعه، برتری و حریم خصوصی دادههای کاربران را پذیرفته و پذیرفتهاند.
arXiv به این ارزشها متعهد است و تنها با همکاریهایی که به آنها پایبند هستند، همکاری میکند.
آیا ایدهای برای پروژهای دارید که بتواند ارزش افزایی برای جامعه arXiv به وجود آورد؟ بیشتر دربارهٔ arXivLabs بیاموزید.
کدام نویسندگان این مقاله تاییدکننده هستند؟
| غیرفعال کردن MathJax (MathJax چیست؟) |