arXiv:2609.04183ترجمه شده

مشاهده پیش از ترکیب: شناسایی رویدادهای انتقالی به‌راهنمایی VLM برای توصیف ویدئوی متراکم با نظارت ضعیف

Ye-Chan Kim، Seunghee Choi، SeungJu Cha، Si-Woo Kim، Hwiseon Kim، Hyungee Kim، Dong-Jin Kim

چکیده

هدف از پوشش‌دهی ویدیوی غنی بدون نظارت ضعیف، شناسایی و توصیف رویدادهای متعدد در ویدیوهای بدون برش با استفاده از مجموعه‌ای مرتب از نامه‌های رویداد برای هر ویدیو است. تحقیقات اخیر با استفاده از مدل‌های زبانی هوش مصنوعی (LLM)، نامه‌های انتقالی کمکی را ترکیب کرده‌اند تا هم‌راستایی بهتری بین بینایی و زبان ایجاد کنند. با این حال، این نامه‌ها فاقد زمین‌بندی بصری هستند و به‌طور سخت‌گیرانه در هر شکاف بین رویدادها در یک موقعیت و مدت زمان ثابت تخصیص داده می‌شوند. برای مقابله با این مشکل، ما چارچوب «دیدن قبل از سنتز» (SBS) را پیشنهاد می‌کنیم که راهنمایی زبانی مبتنی بر بصری را به‌طور تطبیقی و تنها در مکان‌های مورد نیاز فراهم می‌کند. با استفاده از یک مدل هوش مصنوعی چندوجهی (VLM)، روایت‌های سطح فریم برای شکاف‌های بین رویدادها تولید می‌کنیم و از تغییرات معنایی بین آن‌ها برای تشخیص انتقالات استفاده می‌کنیم. برای انتقالات شناسایی‌شده، ماسک‌های زمانی بین رویدادها را به‌طور دقیق‌تری اصلاح می‌کنیم، با ترکیب نقطه وسط زمانی با نقطه تغییر معنایی و انتخاب عرضی که هم‌راستایی بصری-زبانی را به حداکثر می‌رساند. آزمایش‌های انجام‌شده بر روی مجموعه‌های ActivityNet Captions و YouCook2 نشان می‌دهند که این روش عملکردی در سطح بهترین روش‌های موجود در هر دو زمینه زیرنویس‌گذاری و موضع‌یابی دارد.

متن کامل

# علوم کامپیوتر > بینایی ماشین و بازشناسی الگو **عنوان:** دیدن پیش از سنتز: کشف رویدادهای انتقالی هدایت‌شده توسط VLM برای شرح‌نویسی متراکم ویدئویی با نظارت ضعیف **نویسندگان:** Ye-Chan Kim, Seunghee Choi, SeungJu Cha, Si-Woo Kim, Hwiseon Kim, Hyungee Kim, Dong-Jin Kim **چکیده:** هدف این مقاله، شرح‌نویسی متراکم ویدئویی با نظارت ضعیف (Weakly-Supervised Dense Video Captioning) است که همزمان مکان‌یابی و توصیف چندین رویداد در ویدئوهای برش‌نخورده را انجام می‌دهد؛ در حالی که در حال حاضر تنها مجموعه‌ای منظم از شرح‌های سطح رویداد برای هر ویدئویی در دسترس قرار دارد. کارهای اخیر برای ایجاد تراز بینایی-زبانی (vision-language alignment) بیشتر، شرح‌های انتقالی کمکی را از طریق مدل‌های زبانی بزرگ (LLM) سنتز می‌کنند، اما این شرح‌ها فاقد استناد بصری (visual grounding) هستند و به‌طور صلب به هر فاصله بین‌رویدادی در مکان و مدت‌زمانی ثابت اختصاص می‌یابند. برای رفع این مشکلات، ما چارچوب «دیدن پیش از سنتز» (Seeing Before Synthesizing یا SBS) را پیشنهاد می‌کنیم؛ چارچوبی که به‌صورت تطبیقی و تنها در موارد ضروری، هدایت زبانی مستند به بصری را فراهم می‌کند. ما با بهره‌گیری از یک مدل بینایی-زبانی (VLM)، روایت‌های سطح فریم را برای فواصل بین‌رویدادی تولید کرده و انتقال‌ها را از طریق تغییرات معنایی در آن‌ها شناسایی می‌کنیم. سپس برای انتقال‌های شناسایی‌شده، ماسک‌های زمانی بین‌رویدادی را از طریق ترکیب نقطه میانی زمانی با نقطه تغییر معنایی و انتخاب عرضی که تراز بینایی-زبانی را بیشینه می‌کند، بهبود می‌بخشیم. نتایج آزمایشی بر روی مجموعه‌داده‌های ActivityNet Captions و YouCook2، عملکرد پیشرو (state-of-the-art) را در هر دو حوزه شرح‌نویسی و مکان‌یابی نشان می‌دهد. **موضوعات:** بینایی ماشین و بازشناسی الگو (cs.CV)؛ هوش مصنوعی (cs.AI) **ارجاع:** arXiv:2609.04183 [cs.CV] --- ## آرکو لابز (arXivLabs) آرکو لابز (arXivLabs) یک چارچوب است که به همکاران اجازه می‌دهد تا ویژگی‌های جدید آرکو (arXiv) را مستقیماً در وبسایت ما توسعه دهند و به اشتراک بگذارند. هر افراد و سازمان‌هایی که با آرکو لابز (arXivLabs) کار می‌کنند، ارزش‌های باز بودن، جامعه، عالیت و حریم خصوصی داده کاربر را پذیرفته و پایبند شده‌اند. آرکو (arXiv) به این ارزش‌ها التزام دارد و فقط با شرکایی که به آنها پایبند هستند کار می‌کند. ایده‌ای برای پروژه‌ای دارید که ارزشی برای جامعه آرکو (arXiv) اضافه کند؟ بیشتر درباره آرکو لابز (arXivLabs) بدانید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال کردن MathJax (MathJax چیست؟)