ترجمه فارسی مقاله SSL-TTS: اهرم تعبیه شده خود تحت نظارت و بازیابی KNN برای TTS چند بلندگو صفر

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

عنوان مقاله به انگلیسی SSL-TTS: Leveraging Self-Supervised Embeddings and kNN Retrieval for Zero-Shot Multi-speaker TTS
عنوان مقاله به فارسی SSL-TTS: اهرم تعبیه شده خود تحت نظارت و بازیابی KNN برای TTS چند بلندگو صفر
نویسندگان Karl El Hajal, Ajinkya Kulkarni, Enno Hermann, Mathew Magimai. -Doss
فرمت مقاله انگلیسی PDF
تعداد صفحات 5
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Audio and Speech Processing,Artificial Intelligence,Machine Learning,Sound,پردازش صوتی و گفتار , هوش مصنوعی , یادگیری ماشین , صدا ,
توضیحات Submitted 20 August, 2024; originally announced August 2024. , Comments: Submitted to IEEE Signal Processing Letters
توضیحات به فارسی 20 اوت 2024 ارسال شد.در ابتدا اوت 2024 اعلام شد. ، نظرات: ارسال شده به نامه های پردازش سیگنال IEEE
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

While recent zero-shot multispeaker text-to-speech (TTS) models achieve impressive results, they typically rely on extensive transcribed speech datasets from numerous speakers and intricate training pipelines. Meanwhile, self-supervised learning (SSL) speech features have emerged as effective intermediate representations for TTS. It was also observed that SSL features from different speakers that are linearly close share phonetic information while maintaining individual speaker identity, which enables straight-forward and robust voice cloning. In this study, we introduce SSL-TTS, a lightweight and efficient zero-shot TTS framework trained on transcribed speech from a single speaker. SSL-TTS leverages SSL features and retrieval methods for simple and robust zero-shot multi-speaker synthesis. Objective and subjective evaluations show that our approach achieves performance comparable to state-of-the-art models that require significantly larger training datasets. The low training data requirements mean that SSL-TTS is well suited for the development of multi-speaker TTS systems for low-resource domains and languages. We also introduce an interpolation parameter which enables fine control over the output speech by blending voices. Demo samples are available at https://idiap.github.io/ssl-tts

چکیده به فارسی (ترجمه ماشینی)

در حالی که مدل های متنی به گفتار به گفتار (TTS) اخیر اخیر صفر به نتایج چشمگیر دست می یابند ، آنها به طور معمول به مجموعه داده های گفتار رونویسی گسترده از بلندگوهای بی شماری و خطوط لوله آموزش پیچیده متکی هستند.در همین حال ، ویژگی های گفتار یادگیری خود تحت نظارت (SSL) به عنوان بازنمایی های واسطه ای مؤثر برای TTS ظاهر شده است.همچنین مشاهده شد که ویژگی های SSL از بلندگوهای مختلف که ضمن حفظ هویت بلندگوهای فردی ، به طور خطی اطلاعات آوایی را به اشتراک می گذارند ، و این باعث می شود کلونینگ صوتی مستقیم و قوی باشد.در این مطالعه ، ما SSL-TTS را معرفی می کنیم ، یک چارچوب سبک و کارآمد صفر TTS TTS که در گفتار رونویسی شده از یک بلندگو واحد آموزش داده شده است.SSL-TTS از ویژگی های SSL و روش های بازیابی برای سنتز چند بلندگو ساده و قوی استفاده می کند.ارزیابی های عینی و ذهنی نشان می دهد که رویکرد ما به عملکرد قابل مقایسه با مدل های پیشرفته و پیشرفته که به مجموعه داده های آموزشی قابل توجهی بزرگتر نیاز دارند ، دست می یابد.مورد نیاز داده های کم آموزش بدان معنی است که SSL-TTS برای توسعه سیستم های TTS چند بلندگو برای حوزه ها و زبانهای کم منبع مناسب مناسب است.ما همچنین یک پارامتر درون یابی را معرفی می کنیم که با ترکیب صداها ، کنترل خوبی بر گفتار خروجی را امکان پذیر می کند.نمونه های نسخه ی نمایشی در https://idiap.github.io/ssl-tts در دسترس هستند

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.