چکیده
دادههای ارزشمند در منابع بدون ساختار پنهان باقی میمانند: صفحات وب، گزارشها، قراردادها، ثبتها، تماسهای درآمدی و فایلهای PDF. نقطه عطف در هوش مصنوعی سازمانی، بهکارگیری عوامل (agents) مدل زبانی بزرگ (LLM) است که بر روی این دادهها استدلال میکنند تا به سؤالات پیچیده هر کارگر دانشی پاسخ دهند. عوامل میتوانند این کار را امروزه انجام دهند، اما با هزینهای غیرقابلقبول. هر پرسوجو بهطور مکرر اسناد حجیم را بازخوانی میکند تا شواهد پراکنده را بازیابی کند و تا یک میلیون توکن مصرف میکند. با این حال، اگر دادهها از پیش ساختاربندی شده بودند، همین پرسوجو به یک جستجوی ارزان پایگاه داده تبدیل میشد. برای مثال، در معیار ارزیابی FanOutQA، استدلال بر روی یک انباره از پیش ساختاربندیشده ایدهآل ۲۸ برابر ارزانتر است و این شکاف با پراکنده شدن پرسوجوها بر روی اسناد بیشتر، به مرتبههای بزرگتری میرسد. با این حال، ساختاربندی پیشدستانه همهچیز ممکن نیست: اسناد ساختار بالقوه بسیار بیشتری نسبت به هر حجم کاری دارند و ساختار مفید اسناد تا زمان رسیدن پرسوجوها ناشناخته باقی میماند. ما روش شکستن داده عاملمحور (agentic data cracking) را پیشنهاد میکنیم، روشی که دادههای بدون ساختار را بهصورت تطبیقی و پیشدستانه در حین فرایند استدلال، ساختاربندی میکند. ساختاربندی تطبیقی است زیرا پرسوجوهای مشاهدهشده زمان و موضوع آن را تعیین میکنند، و پیشدستانه است زیرا فراتر از پرسوجوی فعلی میرود. هرگاه عامل سندی را برای یافتن پاسخ میگشاید، یک عامل فرعی شکستن با هزینه ناچیز از آن انشعاب میگیرد و ساختار مبتنی بر شواهد را استخراج میکند که احتمالاً برای پرسوجوهای آینده مرتبط خواهد بود. با گذشت زمان، سهم فزایندهای از پرسوجوها صرفاً توسط دادههای ساختاربندیشده پوشش داده میشوند و بدون نیاز به گشودن سند پاسخ داده میشوند، در حالی که دقت عاملمحور حفظ میشود و هزینهای نزدیک به بازیابی و تولید افزوده (RAG) دارد. در معیار ارزیابی FanOutQA، با گسترش تنها یک پرسوجوی مرتبط به ازای هر پرسوجوی آزمون، روش شکستن هزینه را ۵۳ درصد کاهش میدهد و در عین حال دقت را حفظ میکند. شکستن داده عاملمحور گامی نخست به سوی زیرساخت داده نسل بعدی برای استدلال عاملمحور بر روی دادههای بدون ساختار است: زیرسازهای مشترک در زیر مدل که دانشی که استدلال هزینه کشف آن را پرداخت کرده، در آن انباشته میشود.
متن کامل
علوم کامپیوتر > هوش مصنوعی arXiv:2608.31082v1 (cs) [ارسال شده در ۳۱ اوت ۲۰۲۶]
**عنوان:** عاملهای استدلال دادهمحور کممصرف با ساختاردهی تطبیقی دادههای بدون ساختار
**نویسندگان:** میلاد رضایی حاجیدهی، کیتونگ وانگ، استراتوس ایدرئوس
مشاهده PDF مقالهای با عنوان «عاملهای استدلال دادهمحور کممصرف با ساختاردهی تطبیقی دادههای بدون ساختار»، نوشته میلاد رضایی حاجیدهی و دو نویسنده دیگر
مشاهده PDF HTML (آزمایشی)
**چکیده:** دادههای ارزشمند همچنان در منابع بدون ساختار نهفتهاند: صفحات وب، گزارشها، قراردادها، اسناد رسمی، تماسهای اعلام درآمد و فایلهای PDF. شرطبندی بزرگ در هوش مصنوعی سازمانی، استقرار عاملهای مبتنی بر مدلهای زبانی بزرگ (LLM agents) است که برای پاسخگویی به پرسشهای پیچیدهی هر کارمند دانشی، بر روی این دادهها استدلال میکنند. عاملها در حال حاضر قادر به انجام این کار هستند، اما با هزینهای سرسامآور. هر پرسش، بهطور مکرر، اسناد بزرگ را باز میکند تا شواهد پراکنده را بازیابی کند و تا سقف یک میلیون توکن مصرف میکند. با این حال، اگر دادهها از پیش ساختاردهی شده بودند، همان پرسش به یک جستجوی ارزان در پایگاه داده تقلیل مییافت. بهعنوان مثال، در معیار FanOutQA، استدلال بر روی یک ذخیرهگاه ایدهآلِ از پیش ساختاردهیشده، ۲۸ برابر ارزانتر است، و این شکاف با گستردهتر شدن پرسشها در اسناد بیشتر، به مرتبههای بزرگی افزایش مییابد. با این وجود، ساختاردهی همه چیز از قبل امکانپذیر نیست: اسناد حاوی ساختارهای بسیار بیشتری نسبت به آنچه هر وظیفه استفاده کند، هستند، و ساختار و اسناد مفید تا زمان ورود پرسشها مشخص نیستند. ما روش «شکستن دادههای عاملی» (agentic data cracking) را پیشنهاد میکنیم؛ روشی که دادههای بدون ساختار را بهصورت تطبیقی و حدسی (speculative)، بهعنوان محصول جانبی استدلال، ساختاردهی میکند. ساختاردهی تطبیقی است، زیرا پرسشهای مشاهدهشده تعیین میکنند که چه زمانی رخ دهد و چه چیزی مهم است، و حدسی است، زیرا فراتر از پرسش فعلی میرود. هر زمان که عامل، سندی را برای پاسخگویی باز میکند، یک زیرعامل شکستن (cracking sub-agent) با هزینهای جزئی از زمینهی بارگذاریشدهی موجود، فورک میشود و ساختار مبتنی بر شواهد را استخراج میکند که بهاحتمال زیاد برای پرسشهای آتی مرتبط مفید خواهد بود. با گذشت زمان، سهم فزایندهای از پرسشها بهطور کامل توسط دادههای ساختاردهیشده پوشش داده میشوند و بدون باز کردن سند پاسخ داده میشوند، در حالی که دقت عاملی نزدیک به هزینهی RAG باقی میماند. در FanOutQA، که تنها با یک پرسش مرتبط برای هر پرسش آزمایشی توسعه یافته است، شکستن، هزینه را ۵۳٪ کاهش میدهد و در عین حال دقت را حفظ میکند. شکستن دادههای عاملی، گام نخست به سوی زیرساخت دادهای نسل بعدی برای استدلال عاملی بر روی دادههای بدون ساختار است: بستری مشترک در زیر مدل، جایی که دانشی که استدلال از قبل برای کشف آن هزینه کرده است، انباشته میشود.
**توضیحات:**
**موضوعات:** هوش مصنوعی (cs.AI)؛ محاسبات و زبان (cs.CL)؛ پایگاههای داده (cs.DB)
**نحوه استناد:** arXiv:2608.31082 [cs.AI] (یا arXiv:2608.31082v1 [cs.AI] برای این نسخه)
https://doi.org/10.48550/arXiv.2608.31082
برای کسب اطلاعات بیشتر در مورد DOI صادر شده توسط arXiv از طریق DataCite (در انتظار ثبت) مراجعه کنید.
**تاریخچه ارسال:**
از: میلاد رضایی حاجیدهی [مشاهده ایمیل]
[v1] دوشنبه، ۳۱ اوت ۲۰۲۶، ۱۶:۵۳:۴۵ UTC (۴٬۶۴۳ کیلوبایت)
**ابزارهای کتابشناختی**
ابزارهای کتابشناختی و استنادی
کاوشگر کتابشناختی (Bibliographic Explorer)
تغییر وضعیت کاوشگر کتابشناختی (کاوشگر چیست؟)
مقالات مرتبط (Connected Papers)
تغییر وضعیت مقالات مرتبط (مقالات مرتبط چیست؟)
نقشههای ادبیات (Litmaps)
تغییر وضعیت نقشههای ادبیات (Litmaps چیست؟)
جابجایی scite استنادات هوشمند (استنادات هوشمند چیست؟)
کد، دادهها، رسانهها
کد، دادهها و رسانههای مرتبط با این مقاله
جابجایی alphaXiv (alphaXiv چیست؟)
پیوندها به کد
جابجایی CatalyzeX یافتنکننده کد CatalyzeX برای مقالات (CatalyzeX چیست؟)
جابجایی DagsHub (DagsHub چیست؟)
جابجایی Gotit.pub (GotitPub چیست؟)
جابجایی Hugging Face (Hugging Face چیست؟)
جابجایی ScienceCast (ScienceCast چیست؟)
نمایشها
جابجایی Replicate (Replicate چیست؟)
جابجایی Hugging Face Spaces (Spaces چیست؟)
جابجایی TXYZ.AI (TXYZ.AI چیست؟)
مقالات مرتبط
ابزارهای توصیهگر و جستجو
پیوند به گل تأثیر Influence Flower (گلهای تأثیر چیست؟)
جابجایی توصیهگر CORE (CORE چیست؟)
نویسنده
مجله
مؤسسه
موضوع
درباره arXivLabs
arXivLabs: پروژههای آزمایشی با همکاران جامعه
arXivLabs چارچوبی است که به همکاران امکان میدهد ویژگیهای جدید arXiv را مستقیماً در وبسایت ما توسعه دهند و به اشتراک بگذارند. هم افراد و هم سازمانهایی که با arXivLabs کار میکنند، ارزشهای ما از باز بودن، جامعهمحوری، برتری و حریم خصوصی دادههای کاربران را پذیرفتهاند. arXiv به این ارزشها متعهد است و فقط با شرکایی که به آنها پایبند هستند همکاری میکند. آیا ایدهای برای پروژهای دارید که ارزش افزودهای برای جامعه arXiv ایجاد کند؟ درباره arXivLabs بیشتر بدانید.
کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعالسازی MathJax (MathJax چیست؟)