ترجمه فارسی مقاله تولید موسیقی چند منبعی با انتشار نهفته

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Multi-Source Music Generation with Latent Diffusion
عنوان مقاله به فارسی تولید موسیقی چند منبعی با انتشار نهفته
نویسندگان Zhongweiyang Xu, Debottam Dutta, Yu-Lin Wei, Romit Roy Choudhury
فرمت مقاله انگلیسی PDF
تعداد صفحات 5
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Audio and Speech Processing,Machine Learning,Sound,پردازش صوتی و گفتار , یادگیری ماشین , صدا ,
توضیحات Submitted 13 September, 2024; v1 submitted 9 September, 2024; originally announced September 2024. , Comments: ICASSP 2025 in Submission
توضیحات به فارسی ارسال شده 13 سپتامبر 2024 ؛V1 ارسال شده 9 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد. ، نظرات: ICASSP 2025 در ارسال
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Most music generation models directly generate a single music mixture. To allow for more flexible and controllable generation, the Multi-Source Diffusion Model (MSDM) has been proposed to model music as a mixture of multiple instrumental sources (e.g. piano, drums, bass, and guitar). Its goal is to use one single diffusion model to generate mutually-coherent music sources, that are then mixed to form the music. Despite its capabilities, MSDM is unable to generate music with rich melodies and often generates empty sounds. Its waveform diffusion approach also introduces significant Gaussian noise artifacts that compromise audio quality. In response, we introduce a Multi-Source Latent Diffusion Model (MSLDM) that employs Variational Autoencoders (VAEs) to encode each instrumental source into a distinct latent representation. By training a VAE on all music sources, we efficiently capture each source's unique characteristics in a "source latent." The source latents are concatenated and our diffusion model learns this joint latent space. This approach significantly enhances the total and partial generation of music by leveraging the VAE's latent compression and noise-robustness. The compressed source latent also facilitates more efficient generation. Subjective listening tests and Frechet Audio Distance (FAD) scores confirm that our model outperforms MSDM, showcasing its practical and enhanced applicability in music generation systems. We also emphasize that modeling sources is more effective than direct music mixture modeling. Codes and models are available at https://github.com/XZWY/MSLDM. Demos are available at https://xzwy.github.io/MSLDMDemo/.

چکیده به فارسی (ترجمه ماشینی)

بیشتر مدل های تولید موسیقی به طور مستقیم یک ترکیب موسیقی واحد تولید می کنند.برای امکان تولید انعطاف پذیر و قابل کنترل تر ، مدل انتشار چند منبع (MSDM) برای مدل سازی موسیقی به عنوان ترکیبی از منابع ابزاری چندگانه (به عنوان مثال پیانو ، طبل ، باس و گیتار) پیشنهاد شده است.هدف آن استفاده از یک مدل انتشار واحد برای تولید منابع موسیقی متقابلاً با هم است که سپس برای تشکیل موسیقی مخلوط می شوند.با وجود قابلیت های خود ، MSDM قادر به تولید موسیقی با ملودی های غنی نیست و اغلب صداهای خالی ایجاد می کند.رویکرد انتشار شکل موج آن همچنین مصنوعات سر و صدای گاوسی قابل توجهی را معرفی می کند که کیفیت صدا را به خطر می اندازد.در پاسخ ، ما یک مدل انتشار نهفته چند منبع (MSLDM) را معرفی می کنیم که از خودروهای متغیر (VAES) استفاده می کند تا هر منبع ابزاری را در یک بازنمایی پنهان مشخص کند.با آموزش VAE در تمام منابع موسیقی ، ما به طور موثری ویژگی های منحصر به فرد هر منبع را در "منبع نهفته" ضبط می کنیم.تأخیر منبع به هم پیوسته است و مدل انتشار ما این فضای نهفته مشترک را می آموزد.این رویکرد با استفاده از فشرده سازی نهفته VAE و نویز ، باعث افزایش چشمگیر نسل کل و جزئی موسیقی می شود.منبع فشرده شده نهفته نیز نسل کارآمدتری را تسهیل می کند.تست های گوش دادن ذهنی و نمرات فاصله صوتی Frechet (FAD) تأیید می کنند که مدل ما از MSDM بهتر است ، و کاربردهای عملی و پیشرفته خود را در سیستم های تولید موسیقی نشان می دهد.ما همچنین تأکید می کنیم که منابع مدل سازی مؤثرتر از مدل سازی مخلوط موسیقی مستقیم است.کدها و مدل ها در https://github.com/xzwy/msldm در دسترس هستند.نسخه های نمایشی در https://xzwy.github.io/msldmdemo/ در دسترس هستند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.