چکیده
ما یک چارچوب برای طراحی مکانیزمهایی با کارکنان هوش مصنوعی (AI) توسعه میدهیم که ترجیحات (alignments) و تواناییهای (عملهای ممکن و اطلاعات) آنها ناشناختهاند. ما میخواهیم چنین کارکنانها به نمایندگی از ما عمل کنند، بنابراین مکانیزمها باید هم صداقت و هم اطاعت را تشویق کنند. ساختار تقلید یکطرفه---که در آن تواناییها میتوانند پنهان شوند اما نمیتوانند جعل شوند---یک اصل آشکارسازی (revelation principle) را بهدست میآورد، یک ویژگیسازی سیاستهای قابل اجرا از طریق انگیزههای چرخشی چندلایه (nested cyclical monotonicity) و شرایطی که استخراج باورهای بالاترتر میتواند چندین عامل را نظمبند کند. ما این چارچوب را بر مثالهای مشتق (stylized) زیر اعمال میکنیم: (i) sandbagging که در آن یک عامل توانمندتر بهظاهر کمتوانایی عمل میکند؛ (ii) یک معامله trade-off ترجیح‑توضیح، که در ابزار این دو متقابل هستند اما در ارزش مکمل هستند؛ (iii) نظمبندی از طریق امتیازدهی همسایه؛ (iv) پیوند پاداشها برای القای رقابت بین چندین عامل؛ و (v) نظارت قابل گسترش و شکلدادن پاداش.