ترجمه فارسی مقاله مکان یابی و تقسیم بندی صدای بصری چندمقیاس چندگانه

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Multi-scale Multi-instance Visual Sound Localization and Segmentation
عنوان مقاله به فارسی مکان یابی و تقسیم بندی صدای بصری چندمقیاس چندگانه
نویسندگان Shentong Mo, Haofan Wang
فرمت مقاله انگلیسی PDF
تعداد صفحات 11
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computer Vision and Pattern Recognition,Machine Learning,Multimedia,Sound,Audio and Speech Processing,چشم انداز رایانه و تشخیص الگوی , یادگیری ماشین , چندرسانه ای , صدا , صدا و گفتار ,
توضیحات Submitted 31 August, 2024; originally announced September 2024.
توضیحات به فارسی ارسال 31 اوت 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Visual sound localization is a typical and challenging problem that predicts the location of objects corresponding to the sound source in a video. Previous methods mainly used the audio-visual association between global audio and one-scale visual features to localize sounding objects in each image. Despite their promising performance, they omitted multi-scale visual features of the corresponding image, and they cannot learn discriminative regions compared to ground truths. To address this issue, we propose a novel multi-scale multi-instance visual sound localization framework, namely M2VSL, that can directly learn multi-scale semantic features associated with sound sources from the input image to localize sounding objects. Specifically, our M2VSL leverages learnable multi-scale visual features to align audio-visual representations at multi-level locations of the corresponding image. We also introduce a novel multi-scale multi-instance transformer to dynamically aggregate multi-scale cross-modal representations for visual sound localization. We conduct extensive experiments on VGGSound-Instruments, VGG-Sound Sources, and AVSBench benchmarks. The results demonstrate that the proposed M2VSL can achieve state-of-the-art performance on sounding object localization and segmentation.

چکیده به فارسی (ترجمه ماشینی)

بومی سازی صدای بصری یک مشکل معمولی و چالش برانگیز است که مکان اشیاء مربوط به منبع صدا را در یک فیلم پیش بینی می کند.روشهای قبلی عمدتاً از ارتباط صوتی و تصویری بین ویژگی های بصری جهانی و یک مقیاس برای بومی سازی اشیاء صوتی در هر تصویر استفاده می کردند.آنها با وجود عملکرد امیدوارکننده خود ، آنها ویژگی های بصری چند مقیاس تصویر مربوطه را حذف کردند و نمی توانند مناطق تبعیض آمیز را در مقایسه با حقایق زمینی بیاموزند.برای پرداختن به این مسئله ، ما یک چارچوب محلی سازی صدای تصویری چند منظوره چند منظوره ، یعنی M2VSL ، که می تواند به طور مستقیم ویژگی های معنایی چند مقیاس مرتبط با منابع صوتی از تصویر ورودی را برای بومی سازی اشیاء صدا ارائه دهیم ، پیشنهاد می کنیم.به طور خاص ، M2VSL ما از ویژگی های بصری چند مقیاس یادگیری برای تراز کردن بازنمایی های صوتی و تصویری در مکان های چند سطحی از تصویر مربوطه استفاده می کند.ما همچنین یک ترانسفورماتور چند مقیاس چند مقیاس جدید را به نمایش های متقاطع چند مقیاس به صورت پویا برای محلی سازی صدای بصری معرفی می کنیم.ما آزمایش های گسترده ای را در مورد Incstrument VGGSound ، منابع صدا VGG و معیارهای Avsbench انجام می دهیم.نتایج نشان می دهد که M2VSL پیشنهادی می تواند به عملکرد پیشرفته در محلی سازی و تقسیم بندی شیء صدا دست یابد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.