Audio and Speech Processing,Machine Learning,Sound,پردازش صوتی و گفتار , یادگیری ماشین , صدا ,
توضیحات
Submitted 21 August, 2024; originally announced August 2024. , Comments: In Proceedings of the 9th Workshop on Detection and Classification of Acoustic Scenes and Events, DCASE, Tokyo, Japan, 2024. Implementation available on GitHub: https://github.com/OptimusPrimus/salsa
توضیحات به فارسی
ارائه شده 21 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد. ، نظرات: در مجموعه مقالات نهمین کارگاه در مورد تشخیص و طبقه بندی صحنه ها و رویدادهای آکوستیک ، DCASE ، توکیو ، ژاپن ، 2024. اجرای موجود در GitHub: https://github.com/optimusprimus/salsa
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs
چکیده
Dual-encoder-based audio retrieval systems are commonly optimized with contrastive learning on a set of matching and mismatching audio-caption pairs. This leads to a shared embedding space in which corresponding items from the two modalities end up close together. Since audio-caption datasets typically only contain matching pairs of recordings and descriptions, it has become common practice to create mismatching pairs by pairing the audio with a caption randomly drawn from the dataset. This is not ideal because the randomly sampled caption could, just by chance, partly or entirely describe the audio recording. However, correspondence information for all possible pairs is costly to annotate and thus typically unavailable; we, therefore, suggest substituting it with estimated correspondences. To this end, we propose a two-staged training procedure in which multiple retrieval models are first trained as usual, i.e., without estimated correspondences. In the second stage, the audio-caption correspondences predicted by these models then serve as prediction targets. We evaluate our method on the ClothoV2 and the AudioCaps benchmark and show that it improves retrieval performance, even in a restricting self-distillation setting where a single model generates and then learns from the estimated correspondences. We further show that our method outperforms the current state of the art by 1.6 pp. mAP@10 on the ClothoV2 benchmark.
چکیده به فارسی (ترجمه ماشینی)
سیستم های بازیابی صوتی مبتنی بر دوگانه معمولاً با یادگیری متضاد بر روی مجموعه ای از جفت های تطبیق یافته و ناسازگار تنظیم می شوند.این منجر به فضای تعبیه شده مشترک می شود که در آن موارد مربوطه از این دو روش به هم نزدیک می شوند.از آنجا که مجموعه داده های مقاصد صوتی به طور معمول فقط حاوی جفت های متناسب با ضبط و توضیحات است ، با جفت کردن صدا با یک زیرنویس که به طور تصادفی از مجموعه داده ها تهیه شده است ، به یک جفت ناسازگار تبدیل شده است.این ایده آل نیست زیرا زیرنویس نمونه ای به طور تصادفی می تواند ، به طور اتفاقی ، بخشی از آن را توصیف کند.با این حال ، اطلاعات مکاتبات برای همه جفت های ممکن برای حاشیه نویسی و بنابراین به طور معمول در دسترس نیست.بنابراین ، ما پیشنهاد می کنیم که آن را با مکاتبات تخمین زده شده جایگزین کنیم.برای این منظور ، ما یک روش آموزش دو مرحله ای را پیشنهاد می کنیم که در آن مدل های بازیابی چندگانه برای اولین بار طبق معمول ، یعنی بدون مکاتبات تخمین زده شده آموزش می یابند.در مرحله دوم ، مکاتبات صوتی پیش بینی شده توسط این مدل ها سپس به عنوان اهداف پیش بینی عمل می کنند.ما روش خود را در معیار Clothov2 و Audiocaps ارزیابی می کنیم و نشان می دهیم که عملکرد بازیابی را بهبود می بخشد ، حتی در یک تنظیم محدود کننده خود در جایی که یک مدل واحد تولید می کند و سپس از مکاتبات تخمین زده می شود.ما همچنین نشان می دهیم که روش ما از وضعیت فعلی هنر با 1.6 صفحه استفاده می کند.
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs