arXiv:2609.09153ترجمه شده

گراف‌های رویه‌ای: ساختارهای اجرایی خودتکاملی برای آژانت‌های LLM

Yuxing Lu، Yicheng Chen، Shanchan Wu، Sercan Ö. Arık

چکیده

مدل‌های زبانی بزرگ (LLM) به‌طور فزاینده به‌عنوان عوامل (agents) مستقر می‌شوند که در افق‌های طولانی برنامه‌ریزی می‌کنند و از طریق ابزارهای خارجی عمل می‌کنند. اکثر عوامل، از طریق تولید بی‌محدود، بر تاریخچهٔ تجمعی اقدامات تکیه می‌کنند و دانش رویه‌ای مربوط به «چه کاری باید انجام شود»، «در چه ترتیبی» و «تحت چه شرایطی» را ضمنی فرض می‌کنند. با افزایش طول مسیرها (trajectories)، عوامل می‌توانند از هدف‌های خود بی‌اختیار شوند، ابزارها را به ترتیب نادرست فراخوانی کنند و اقدامات غیرمنتج را تکرار کنند. ما گراف رویه‌ای (Procedural Graph) را معرفی می‌کنیم: به همان شکل که یک گراف دانش، دانش واقعی را به سه‌تایی (entity, relation, entity) برای سوالات «چه چیزی است» سازماندهی می‌کند، گراف رویه‌ای دانش رویه‌ای را به سه‌تایی (procedure, relation, procedure) برای سوالات «چه کاری باید انجام شود» سازماندهی می‌کند. در هر گام تصمیم‌گیری، چارچوب گره فعال، موقعیت عامل را مکان‌یابی می‌کند و یک مدل راهنمایی، زیرگراف اطراف را به راهنمایی سطح‌گام (situational) تبدیل می‌کند که عمل بعدی حلال را بدون تعیین قطعی، به سمت آن سوگیری متمایل می‌سازد. این گراف خود‌توسعه‌یافته است: یک بازسازی مدل زبانی بزرگ (LLM refiner) مسیرهای ناموفق را با مسیرهای موفق مقایسه می‌کند و توپولوژی و ویژگی‌های گراف را ویرایش می‌کند؛ ویرایش‌هایی که عملکرد اعتبارسنجی held-out را حفظ یا بهبود می‌بخشند، اعمال می‌شوند و موارد رد شده حفظ می‌شوند تا تکرار آن‌ها ممانعة شود. از یک اسکلت کمینه (minimal skeleton) شروع می‌شود، به‌صورت حلقه‌ای گراف‌هایی می‌سازد که با یا برابر یا برتر از گراف‌های طراحی‌شدهٔ دستی عمل می‌کنند. همچنین می‌تواند پیش‌فرض سوگیری‌دار متخصص را جبران کند. در چندین مجموعهٔ داده، برای انواع وظایف و مدل‌های زبانی بزرگ، گراف رویه‌ای بهبودهای پایدارتری نسبت به مبنای مبتنی بر حافظه ارائه می‌دهد و نسخهٔ خود‌توسعه‌یافته، بدون نیاز به مهندسی دستی، عملکرد را بیشتر می‌سازد.

متن کامل

عنوان: گراف‌های رویه‌ای: ساختارهای اجرایی خود-توسعه‌یافته برای عوامل LLM نویسندگان: یوکسینگ لو، ییچنگ چن، شانچان وو، سرجان او. آریك چکیده: مدل‌های زبانی بزرگ به‌طور فزاینده‌ای به‌عنوان عواملی مورد استفاده قرار می‌گیرند که برنامه‌ریزی را در افق‌های زمانی طولانی انجام می‌دهند و از طریق ابزارهای خارجی عمل می‌کنند. اکثر عوامل، اقدامات خود را از طریق تولید بدون محدودیت بر روی تاریخچهٔ تجمیع‌شده انتخاب می‌کنند، که در نتیجه دانش عملی مربوط به «آنچه باید انجام شود»، «آنچه باید به چه ترتیبی انجام شود» و «آنچه باید تحت چه شرایطی انجام شود» به صورت ضمنی باقی می‌ماند. با طولانی‌تر شدن مسیرها، عوامل ممکن است از هدف خود دور شوند، ابزارها را به ترتیب نادرست فراخوانی کنند و اقدامات غیرمفید را تکرار کنند. ما گراف عملی را معرفی می‌کنیم: همان‌گونه که گراف دانش، دانش واقعی را به صورت سه‌مت (وجود, رابطه, موجود) برای پاسخ به سوال «آنچه است» سازماندهی می‌کند، گراف عملی دانش عملی را به صورت سه‌مت (عمل, رابطه, عمل) برای پاسخ به سوال «آنچه باید انجام شود» سازماندهی می‌کند. در هر گام تصمیم‌گیری، چارچوب، گره فعال عامل را مکان‌یابی می‌کند و یک مدل راهنمایی زیرگراف اطراف را به راهنمایی سطح گام‌های فعلی تبدیل می‌کند که عمل بعدی را بدون تعیین قطعی، به سمت آن هدایت می‌کند. گراف عملی خود-توسعه‌یافته است: یک به‌روزرسانی مدل زبانی بزرگ (LLM) مسیرهای ناموفق را با مسیرهای موفق مقایسه می‌کند، توپولوژی و ویژگی‌های گراف را ویرایش می‌کند و ویرایش‌هایی را ثبت می‌کند که عملکرد اعتبارسنجی held-out را حفظ یا بهبود می‌بخشد، در حالی که موارد رد شده را حفظ می‌کند تا از تکرار آن‌ها جلوگیری کند. از یک اسکل اولیه شروع می‌کند، این حلقه گراف‌هایی را می‌سازد که با یا بهتر از گراف‌های دستی طراحی‌شده برابری می‌کنند. همچنین می‌تواند یک پیش‌نیاز تخصصی معیوب را جبران کند. در چندین دیتاست، نوع وظیفه و مدل‌های زبانی بزرگ (LLM)، گراف عملی بهبودهای پایداری نسبت به پایگاه‌های مبتنی بر حافظه ارائه می‌دهد و خود-توسعه‌یافته، بدون نیاز به مهندسی دستی، عملکرد را بهبود می‌بخشد. موضوعات: هوش مصنوعی (cs.AI); محاسبه و زبان (cs.CL); سیستم‌های چندعامله‌ای (cs.MA) منبع برای استشهاد: arXiv:2609.09153 [cs.AI] (یا arXiv:2609.09153v1 [cs.AI] برای این نسخه) لینک: https://doi.org/10.48550/arXiv.2609.09153 اطلاعات بیشتر: DOI صادر شده توسط arXiv از طریق DataCite (در حال ثبت) قابل دسترسی است. تاریخ ارسال: از یوکسینگ لو [مشاهده ایمیل] [v1] سه‌شنبه، ۸ سپتامبر ۲۰۲۶ ۱۷:۵۹:۴۱ UTC (۴,۸۹۶ KB) ابزارهای بایوگرافی: ابزارهای بایوگرافی: ابزارهای بایوگرافی و استشهاد، کاوشگر بایوگرافی (کاوشگر بایوگرافی چیست؟)، مقالات مرتبط، کاوشگر مقالات مرتبط (مقالات مرتبط چیست؟)، Litmaps، کاوشگر Litmaps (Litmaps چیست؟)، scite.ai، کاوشگر smarts citations (smarts citations چیست؟) کد، داده و رسانه: کد، داده و رسانه: کد، داده و رسانه مرتبط با این مقاله، alphaXiv، کاوشگر alphaXiv (alphaXiv چیست؟)، لینک‌های به کد، کاوشگر CatalyzeX Code Finder for Papers (CatalyzeX Code Finder for Papers چیست؟)، DagsHub، کاوشگر DagsHub (DagsHub چیست؟)، GotitPub، کاوشگر Gotit.pub (Gotit.pub چیست؟)، Hugging Face، کاوشگر Hugging Face (Hugging Face چیست؟) Science: Science، ceCast توییگ ScienceCast (ScienceCast چیست؟)، دیموهای Replicate، توییگ Replicate (Re...