ترجمه فارسی مقاله مطابقت های تخمینی زیرنویس صوتی، بازیابی صدا را بر اساس زبان بهبود می بخشد

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

عنوان مقاله به انگلیسی Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
عنوان مقاله به فارسی مطابقت های تخمینی زیرنویس صوتی، بازیابی صدا را بر اساس زبان بهبود می بخشد
نویسندگان Paul Primus, Florian Schmid, Gerhard Widmer
فرمت مقاله انگلیسی PDF
تعداد صفحات 5
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Audio and Speech Processing,Machine Learning,Sound,پردازش صوتی و گفتار , یادگیری ماشین , صدا ,
توضیحات Submitted 21 August, 2024; originally announced August 2024. , Comments: In Proceedings of the 9th Workshop on Detection and Classification of Acoustic Scenes and Events, DCASE, Tokyo, Japan, 2024. Implementation available on GitHub: https://github.com/OptimusPrimus/salsa
توضیحات به فارسی ارائه شده 21 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد. ، نظرات: در مجموعه مقالات نهمین کارگاه در مورد تشخیص و طبقه بندی صحنه ها و رویدادهای آکوستیک ، DCASE ، توکیو ، ژاپن ، 2024. اجرای موجود در GitHub: https://github.com/optimusprimus/salsa
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Dual-encoder-based audio retrieval systems are commonly optimized with contrastive learning on a set of matching and mismatching audio-caption pairs. This leads to a shared embedding space in which corresponding items from the two modalities end up close together. Since audio-caption datasets typically only contain matching pairs of recordings and descriptions, it has become common practice to create mismatching pairs by pairing the audio with a caption randomly drawn from the dataset. This is not ideal because the randomly sampled caption could, just by chance, partly or entirely describe the audio recording. However, correspondence information for all possible pairs is costly to annotate and thus typically unavailable; we, therefore, suggest substituting it with estimated correspondences. To this end, we propose a two-staged training procedure in which multiple retrieval models are first trained as usual, i.e., without estimated correspondences. In the second stage, the audio-caption correspondences predicted by these models then serve as prediction targets. We evaluate our method on the ClothoV2 and the AudioCaps benchmark and show that it improves retrieval performance, even in a restricting self-distillation setting where a single model generates and then learns from the estimated correspondences. We further show that our method outperforms the current state of the art by 1.6 pp. mAP@10 on the ClothoV2 benchmark.

چکیده به فارسی (ترجمه ماشینی)

سیستم های بازیابی صوتی مبتنی بر دوگانه معمولاً با یادگیری متضاد بر روی مجموعه ای از جفت های تطبیق یافته و ناسازگار تنظیم می شوند.این منجر به فضای تعبیه شده مشترک می شود که در آن موارد مربوطه از این دو روش به هم نزدیک می شوند.از آنجا که مجموعه داده های مقاصد صوتی به طور معمول فقط حاوی جفت های متناسب با ضبط و توضیحات است ، با جفت کردن صدا با یک زیرنویس که به طور تصادفی از مجموعه داده ها تهیه شده است ، به یک جفت ناسازگار تبدیل شده است.این ایده آل نیست زیرا زیرنویس نمونه ای به طور تصادفی می تواند ، به طور اتفاقی ، بخشی از آن را توصیف کند.با این حال ، اطلاعات مکاتبات برای همه جفت های ممکن برای حاشیه نویسی و بنابراین به طور معمول در دسترس نیست.بنابراین ، ما پیشنهاد می کنیم که آن را با مکاتبات تخمین زده شده جایگزین کنیم.برای این منظور ، ما یک روش آموزش دو مرحله ای را پیشنهاد می کنیم که در آن مدل های بازیابی چندگانه برای اولین بار طبق معمول ، یعنی بدون مکاتبات تخمین زده شده آموزش می یابند.در مرحله دوم ، مکاتبات صوتی پیش بینی شده توسط این مدل ها سپس به عنوان اهداف پیش بینی عمل می کنند.ما روش خود را در معیار Clothov2 و Audiocaps ارزیابی می کنیم و نشان می دهیم که عملکرد بازیابی را بهبود می بخشد ، حتی در یک تنظیم محدود کننده خود در جایی که یک مدل واحد تولید می کند و سپس از مکاتبات تخمین زده می شود.ما همچنین نشان می دهیم که روش ما از وضعیت فعلی هنر با 1.6 صفحه استفاده می کند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.