چکیده
زبان طبیعی به عنوان کانال اصلی بازخورد برای بهبود عملکرد عوامل زبانی در حال ظهور است؛ این زبان میتواند قصد، ترجیحات و ساختار علی را به شکلی قابل تفسیر برای هم انسانها و هم مدلهای زبانی مدرن منتقل کند. ما این الگو را یادگیری تقویتی کلامی (VRL) مینامیم و اولین توصیف جامع آن را ارائه میکنیم. ما این حوزه را حول یک محور واحد سازماندهی میکنیم: اینکه بازخورد کلامی کی و چگونه در چرخه زندگی عامل تأثیر میگذارد و چه چیزی را تغییر میدهد. این امر منجر به سه ستون میشود: (۱) زبان به عنوان سیگنال پایهگذاری، که در آن زبان خود وظیفه را با تعیین اهداف، حالات و ساختارهای پاداش تعریف میکند؛ (۲) زبان به عنوان بازخورد تأملگرانه، که در آن زبان طبیعی در حین آزمایش، راهنمای استدلال است و نیازی به بهروزرسانی پارامترهای مدل ندارد؛ (۳) زبان به عنوان سیگنال یادگیری، که در آن بازخورد مبتنی بر زبان، پارامترهای مدل را در طول آموزش شکل میدهد. در هر ستون، ما نمونههایی از آثار را تلفیق میکنیم، زیرگروههای کلیدی رویکردها را شناسایی میکنیم و نقش متمایز زبان را در شکلدهی به رفتار عامل توضیح میدهیم. این طبقهبندی به طور کلی نشان میدهد که چگونه تقویت کلامی در حال بازسازی توسعه عامل است و در عین حال چالشها و فرصتهای ساخت عوامل توانمندتر و هماهنگتر را نیز مشخص میکند.
متن کامل
علم کامپیوتر > محاسبات و زبان
arXiv:2609.01597v1 (cs) [ارسال شده در ۱ سپتامبر ۲۰۲۶]
**عنوان:** ظهور یادگیری تقویتی کلامی
**نویسندگان:** کشیج تایال، آرون شارما، جنتا ایندیرا ویناتا، آنیربان داس، سامبیت ساهو
مشاهده نسخه PDF مقاله با عنوان «ظهور یادگیری تقویتی کلامی» اثر کشیج تایال و ۴ نویسنده دیگر | مشاهده PDF | HTML (آزمایشی)
**چکیده:** زبان طبیعی در حال تبدیل شدن به یک کانال بازخورد اصلی برای بهبود عوامل (agents) زبانی است؛ کانالی که قادر است قصد، ترجیحات و ساختارهای علّی را به شکلی منتقل کند که هم برای انسانها و هم برای مدلهای زبانی مدرن قابل تفسیر باشد. ما این پارادایم را «یادگیری تقویتی کلامی» (VRL) مینامیم و نخستین توصیف یکپارچه از آن را ارائه میدهیم. ما این حوزه را حول یک محور واحد سازماندهی میکنیم: اینکه بازخورد کلامی در «چه زمانی» از چرخه حیات یک عامل تأثیر میگذارد و «چه چیزی» را تغییر میدهد؛ این محور منجر به شکلگیری سه ستون اصلی میشود: (۱) **زبان به عنوان سیگنال زمینهای**، که در آن زبان با تعیین اهداف، حالات و ساختارهای پاداش، خود وظیفه را تعریف میکند؛ (۲) **زبان به عنوان بازخورد تفکری**، که در آن زبان طبیعی بدون نیاز به بهروزرسانی پارامترهای مدل، استدلال را در زمان آزمون هدایت میکند؛ (۳) **زبان به عنوان سیگنال یادگیری**، که در آن بازخورد مبتنی بر زبان، پارامترهای مدل را از طریق آموزش شکل میدهد. ما در هر یک از این ستونها، کارهای مربوط به بازنمایی (representation) را ترکیب کرده، زیرمجموعههای کلیدی رویکردها را متمایز ساخته و نقش متفاوت زبان را در شکلدهی به رفتار عامل ترسیم میکنیم. در مجموع، این طبقهبندی نشان میدهد که چگونه یادگیری تقویتی کلامی در حال بازتعریف توسعه عاملها است و همزمان، چالشها و فرصتهای ساخت عاملهای توانمندتر و همسوتر را مشخص میکند.
**موضوعات:** محاسبات و زبان (cs.CL)؛ هوش مصنوعی (cs.AI)
**استناد:** arXiv:2609.01597 [cs.CL] (یا arXiv:2609.01597v1 [cs.CL] برای این نسخه) https://doi.org/10.48550/arXiv.2609.01597
**سوابق ارسال:**
از: کشیج تایال [مشاهده ایمیل] [v1] سهشنبه، ۱ سپتامبر ۲۰۲۶ ۱۷:۵۸:۱۸ UTC (۱,۶۶۷ کیلوبایت)
نویسنده محل انتشار نهاد موضوع درباره arXivLabs: پروژههای آزمایشی با همکاری جامعه arXivLabs یک چارچوب است که به همکاران اجازه میدهد ویژگیهای جدید arXiv را مستقیماً در وبسایت ما توسعه داده و به اشتراک بگذارند. هر فرد یا سازمانی که با arXivLabs همکاری میکند، ارزشهای ما یعنی شفافیت، جامعهمحوری، کیفیت و حریم خصوصی دادههای کاربران را پذیرفته است. arXiv متعهد به این ارزشهاست و تنها با شرکایی همکاری میکند که از آنها پیروی کنند. ایدهای برای پروژهای دارید که به جامعه arXiv ارزش افزوده دهد؟ درباره arXivLabs بیشتر بیاموزید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال کردن MathJax (MathJax چیست؟)