چکیده
مدلهای زبانی بزرگ (LLM) بهطور فزاینده بهعنوان عوامل (agents) مستقر میشوند که در افقهای طولانی برنامهریزی میکنند و از طریق ابزارهای خارجی عمل میکنند.
اکثر عوامل، از طریق تولید بیمحدود، بر تاریخچهٔ تجمعی اقدامات تکیه میکنند و دانش رویهای مربوط به «چه کاری باید انجام شود»، «در چه ترتیبی» و «تحت چه شرایطی» را ضمنی فرض میکنند.
با افزایش طول مسیرها (trajectories)، عوامل میتوانند از هدفهای خود بیاختیار شوند، ابزارها را به ترتیب نادرست فراخوانی کنند و اقدامات غیرمنتج را تکرار کنند.
ما گراف رویهای (Procedural Graph) را معرفی میکنیم: به همان شکل که یک گراف دانش، دانش واقعی را به سهتایی (entity, relation, entity) برای سوالات «چه چیزی است» سازماندهی میکند، گراف رویهای دانش رویهای را به سهتایی (procedure, relation, procedure) برای سوالات «چه کاری باید انجام شود» سازماندهی میکند.
در هر گام تصمیمگیری، چارچوب گره فعال، موقعیت عامل را مکانیابی میکند و یک مدل راهنمایی، زیرگراف اطراف را به راهنمایی سطحگام (situational) تبدیل میکند که عمل بعدی حلال را بدون تعیین قطعی، به سمت آن سوگیری متمایل میسازد.
این گراف خودتوسعهیافته است: یک بازسازی مدل زبانی بزرگ (LLM refiner) مسیرهای ناموفق را با مسیرهای موفق مقایسه میکند و توپولوژی و ویژگیهای گراف را ویرایش میکند؛ ویرایشهایی که عملکرد اعتبارسنجی held-out را حفظ یا بهبود میبخشند، اعمال میشوند و موارد رد شده حفظ میشوند تا تکرار آنها ممانعة شود.
از یک اسکلت کمینه (minimal skeleton) شروع میشود، بهصورت حلقهای گرافهایی میسازد که با یا برابر یا برتر از گرافهای طراحیشدهٔ دستی عمل میکنند. همچنین میتواند پیشفرض سوگیریدار متخصص را جبران کند.
در چندین مجموعهٔ داده، برای انواع وظایف و مدلهای زبانی بزرگ، گراف رویهای بهبودهای پایدارتری نسبت به مبنای مبتنی بر حافظه ارائه میدهد و نسخهٔ خودتوسعهیافته، بدون نیاز به مهندسی دستی، عملکرد را بیشتر میسازد.
متن کامل
عنوان: گرافهای رویهای: ساختارهای اجرایی خود-توسعهیافته برای عوامل LLM
نویسندگان: یوکسینگ لو، ییچنگ چن، شانچان وو، سرجان او. آریك
چکیده: مدلهای زبانی بزرگ بهطور فزایندهای بهعنوان عواملی مورد استفاده قرار میگیرند که برنامهریزی را در افقهای زمانی طولانی انجام میدهند و از طریق ابزارهای خارجی عمل میکنند. اکثر عوامل، اقدامات خود را از طریق تولید بدون محدودیت بر روی تاریخچهٔ تجمیعشده انتخاب میکنند، که در نتیجه دانش عملی مربوط به «آنچه باید انجام شود»، «آنچه باید به چه ترتیبی انجام شود» و «آنچه باید تحت چه شرایطی انجام شود» به صورت ضمنی باقی میماند. با طولانیتر شدن مسیرها، عوامل ممکن است از هدف خود دور شوند، ابزارها را به ترتیب نادرست فراخوانی کنند و اقدامات غیرمفید را تکرار کنند. ما گراف عملی را معرفی میکنیم: همانگونه که گراف دانش، دانش واقعی را به صورت سهمت (وجود, رابطه, موجود) برای پاسخ به سوال «آنچه است» سازماندهی میکند، گراف عملی دانش عملی را به صورت سهمت (عمل, رابطه, عمل) برای پاسخ به سوال «آنچه باید انجام شود» سازماندهی میکند. در هر گام تصمیمگیری، چارچوب، گره فعال عامل را مکانیابی میکند و یک مدل راهنمایی زیرگراف اطراف را به راهنمایی سطح گامهای فعلی تبدیل میکند که عمل بعدی را بدون تعیین قطعی، به سمت آن هدایت میکند. گراف عملی خود-توسعهیافته است: یک بهروزرسانی مدل زبانی بزرگ (LLM) مسیرهای ناموفق را با مسیرهای موفق مقایسه میکند، توپولوژی و ویژگیهای گراف را ویرایش میکند و ویرایشهایی را ثبت میکند که عملکرد اعتبارسنجی held-out را حفظ یا بهبود میبخشد، در حالی که موارد رد شده را حفظ میکند تا از تکرار آنها جلوگیری کند. از یک اسکل اولیه شروع میکند، این حلقه گرافهایی را میسازد که با یا بهتر از گرافهای دستی طراحیشده برابری میکنند. همچنین میتواند یک پیشنیاز تخصصی معیوب را جبران کند. در چندین دیتاست، نوع وظیفه و مدلهای زبانی بزرگ (LLM)، گراف عملی بهبودهای پایداری نسبت به پایگاههای مبتنی بر حافظه ارائه میدهد و خود-توسعهیافته، بدون نیاز به مهندسی دستی، عملکرد را بهبود میبخشد.
موضوعات: هوش مصنوعی (cs.AI); محاسبه و زبان (cs.CL); سیستمهای چندعاملهای (cs.MA)
منبع برای استشهاد: arXiv:2609.09153 [cs.AI] (یا arXiv:2609.09153v1 [cs.AI] برای این نسخه)
لینک: https://doi.org/10.48550/arXiv.2609.09153
اطلاعات بیشتر: DOI صادر شده توسط arXiv از طریق DataCite (در حال ثبت) قابل دسترسی است.
تاریخ ارسال: از یوکسینگ لو [مشاهده ایمیل] [v1] سهشنبه، ۸ سپتامبر ۲۰۲۶ ۱۷:۵۹:۴۱ UTC (۴,۸۹۶ KB)
ابزارهای بایوگرافی: ابزارهای بایوگرافی: ابزارهای بایوگرافی و استشهاد، کاوشگر بایوگرافی (کاوشگر بایوگرافی چیست؟)، مقالات مرتبط، کاوشگر مقالات مرتبط (مقالات مرتبط چیست؟)، Litmaps، کاوشگر Litmaps (Litmaps چیست؟)، scite.ai، کاوشگر smarts citations (smarts citations چیست؟)
کد، داده و رسانه: کد، داده و رسانه: کد، داده و رسانه مرتبط با این مقاله، alphaXiv، کاوشگر alphaXiv (alphaXiv چیست؟)، لینکهای به کد، کاوشگر CatalyzeX Code Finder for Papers (CatalyzeX Code Finder for Papers چیست؟)، DagsHub، کاوشگر DagsHub (DagsHub چیست؟)، GotitPub، کاوشگر Gotit.pub (Gotit.pub چیست؟)، Hugging Face، کاوشگر Hugging Face (Hugging Face چیست؟)
Science: Science، ceCast توییگ ScienceCast (ScienceCast چیست؟)، دیموهای Replicate، توییگ Replicate (Re...