arXiv:2609.01560ترجمه شده

H3-World: تبدیل درک زبان به کنترل جهان

Danze Chen، Zeqing Wang، Ziyue Lin، Xingyi Yang، Yeying Jin

چکیده

ما در این مقاله، H3-World را معرفی می‌کنیم؛ یک چارچوب کارآمد که مولد ویدیوی MiniMax-H3 با ۳۳ میلیارد پارامتر را به یک مدل جهان تعاملی تبدیل می‌کند. یافته‌های ما نشان می‌دهد که با پیشرفت مولدهای ویدیوی بزرگ، زبان به‌عنوان واسط طبیعی برای کنترل در حال ظهور است. به‌عنوان نمونه، MiniMax-H3 در حال حاضر از کنترل بدون نیاز به نمونه‌برداری آموزشی (zero-shot) برای رفتار شخصیت‌ها و حرکت دوربین از طریق دستورات زبان طبیعی پشتیبانی می‌کند. H3-World با بهره‌گیری از این قابلیت، این واسط زبانیِ عمومی را به کنترل دقیقِ مقید به زمان در سطح جهان تبدیل می‌کند، بدون آنکه ماژول‌های اقدام اختصاصی معرفی نماید. به‌طور مشخص، ما هر اقدام را به‌صورت ترکیبی ساخت‌یافته از دستورات شخصیت و دوربین نمایش می‌دهیم و آن‌ها را با متن‌های نهفته ویدیوی متناظرشان در بُعد زمان هم‌راستا می‌سازیم. برای دقیق‌تر ساختن کنترل از نظر زمانی، ما همچنین مسیریابی توجه زمانی (temporal attention routing) را معرفی می‌کنیم که هر دستور را به بازه زمانی مورد نظر محدود می‌سازد و نشت کنترل میان اقدامات مختلف را کاهش می‌دهد. نکته مهم آنکه H3-World مستقیماً از نمایش‌های معنایی فراگرفته‌شده در طول پیش‌آموزش ویدیوی مقیاس‌بزرگ بهره می‌گیرد و تنها به تطبیق سبکی نیاز دارد. H3-World با تنها ۸٬۰۰۰ نمونه بازی، ۱۰٬۰۰۰ گام بهینه‌سازی LoRA، و ۰٫۱۹۹ درصد پارامتر قابل آموزش، به کنترل مؤثر شخصیت و دوربین دست می‌یابد و در عین حال کیفیت تولید بالا را حفظ می‌کند. این مدل همچنین توانایی تعمیم به سناریوهای دیده‌نشده را دارد. این نتایج نشان می‌دهد که قابلیت‌های کنترلیِ در حال ظهور در مولدهای ویدیوی بزرگ را می‌توان به‌طور کارآمد برای کنترل جهانی تعاملی به‌کار گرفت.

متن کامل

رشته کامپیوتر > بینایی کامپیوتر و تشخیص الگو arXiv:2609.01560v1 (cs) [ارسال شده در ۱ سپتامبر ۲۰۲۶] **عنوان:** H3-World: تبدیل درک زبان به کنترل جهان **نویسندگان:** Danze Chen, Zeqing Wang, Ziyue Lin, Xingyi Yang, Yeying Jin مشاهده نسخه PDF مقاله با عنوان H3-World: تبدیل درک زبان به کنترل جهان، نوشته Danze Chen و ۴ نویسنده دیگر مشاهده PDF | HTML (آزمایشی) **چکیده:** ما H3-World را ارائه می‌دهیم، یک چارچوب کارآمد که ژنراتور ویدیویی 33B MiniMax-H3 را به یک مدل جهانی تعاملی تبدیل می‌کند. یافته کلیدی ما این است که با قدرتمندتر شدن ژنراتورهای ویدیویی بزرگ، زبان به‌عنوان رابطی طبیعی برای کنترل ظهور می‌یابد. به‌عنوان نمونه، MiniMax-H3 از پیش از کنترل بدون‌نظارت (zero-shot) رفتار شخصیت و حرکت دوربین از طریق دستورهای زبان طبیعی پشتیبانی می‌کند. بر این اساس، H3-World این رابط زبانی ابتدایی را بدون معرفی ماژول‌های عمل اختصاصی، به کنترل جهانی دقیق و زمانی-مبنا ارتقا می‌دهد. به‌طور مشخص، ما هر عمل را به‌صورت ترکیبی ساختاریافته از دستورهای شخصیت و دوربین نمایش می‌دهیم و آن‌ها را با کدهای نهان ویدیویی زمانی متناظر تراز می‌کنیم. برای دقیق‌تر کردن کنترل زمانی، ما همچنین مسیریابی توجه زمانی (temporal attention routing) را معرفی می‌کنیم که هر دستور را به بازه زمانی مورد نظرش محدود می‌سازد و نشت کنترل میان اعمال را کاهش می‌دهد. نکته مهم آنکه H3-World مستقیماً از بازنمایی‌های معنایی آموخته‌شده در پیش‌آموزش ویدیویی مقیاس‌بزرگ بهره می‌گیرد و تنها به انطباق سبک‌وزن نیاز دارد. تنها با ۸۰۰۰ نمونه گیم‌پلی، ۱۰۰۰۰ گام بهینه‌سازی LoRA، و ۰/۱۹۹٪ پارامترهای قابل آموزش، H3-World ضمن حفظ کیفیت تولید قوی، کنترل مؤثر شخصیت و دوربین را به دست می‌آورد. همچنین به سناریوهای دیده‌نشده نیز تعمیم می‌یابد. این نتایج نشان می‌دهند که قابلیت‌های کنترلی ظهوریافته در ژنراتورهای ویدیویی بزرگ می‌توانند به‌طور کارآمد به کنترل جهانی تعاملی تبدیل شوند. **موضوعات:** بینایی کامپیوتر و تشخیص الگو (cs.CV)؛ هوش مصنوعی (cs.AI) **استناد:** arXiv:2609.01560 [cs.CV] (یا arXiv:2609.01560v1 [cs.CV] برای این نسخه) https://doi.org/10.48550/arXiv.2609.01560 **تاریخچه ارسال:** از: Danze Chen [مشاهده ایمیل] [v1] سه‌شنبه، ۱ سپتامبر ۲۰۲۶ ۱۷:۲۱:۴۰ UTC (۴۶۵۹۸ کیلوبایت) فعال‌سازی/غیرفعال‌سازی Hugging Face Spaces (Spaces چیست؟) فعال‌سازی/غیرفعال‌سازی TXYZ.AI Spaces (TXYZ.AI چیست؟) مقالات مرتبط سیستم‌های پیشنهاددهنده و ابزارهای جستجو پیوند به گل تأثیرگذاری گل تأثیرگذاری (گل‌های تأثیرگذاری چیست؟) فعال‌سازی/غیرفعال‌سازی سیستم پیشنهاددهنده CORE CORE Recommender (CORE چیست؟) نویسنده محل انتشار مؤسسه موضوع درباره arXivLabs arXivLabs: پروژه‌های آزمایشی با همکاری اعضای جامعه arXivLabs چارچوبی است که به همکاران امکان می‌دهد ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه داده و به اشتراک بگذارند. هم افراد و هم سازمان‌هایی که با arXivLabs کار می‌کنند، ارزش‌های ما یعنی گشودگی، جامعه‌محوری، برتری و حریم خصوصی داده‌های کاربران را پذیرفته‌اند. arXiv به این ارزش‌ها متعهد است و تنها با شرکایی که آن‌ها را رعایت می‌کنند همکاری می‌کند. آیا ایده‌ای برای پروژه‌ای دارید که ارزشی برای جامعه arXiv ایجاد کند؟ درباره arXivLabs بیشتر بدانید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال‌سازی MathJax (MathJax چیست؟)