ترجمه فارسی مقاله WavTokenizer: یک کدک گسسته آکوستیک توکنایزر کارآمد برای مدلسازی زبان صوتی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
عنوان مقاله به فارسی WavTokenizer: یک کدک گسسته آکوستیک توکنایزر کارآمد برای مدلسازی زبان صوتی
نویسندگان Shengpeng Ji, Ziyue Jiang, Xize Cheng, Yifu Chen, Minghui Fang, Jialong Zuo, Qian Yang, Ruiqi Li, Ziang Zhang, Xiaoda Yang, Rongjie Huang, Yidi Jiang, Qian Chen, Siqi Zheng, Wen Wang, Zhou Zhao
فرمت مقاله انگلیسی PDF
تعداد صفحات 15
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Audio and Speech Processing,Machine Learning,Multimedia,Sound,Signal Processing,پردازش صوتی و گفتار , یادگیری ماشین , چندرسانه ای , صدا , پردازش سیگنال ,
توضیحات Submitted 29 August, 2024; originally announced August 2024. , Comments: Working in progress. arXiv admin note: text overlap with arXiv:2402.12208
توضیحات به فارسی ارسال شده 29 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد. ، نظرات: کار در حال انجام.Arxiv Admin توجه: همپوشانی متن با ARXIV: 2402.12208
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Language models have been effectively applied to modeling natural signals, such as images, video, speech, and audio. A crucial component of these models is the codec tokenizer, which compresses high-dimensional natural signals into lower-dimensional discrete tokens. In this paper, we introduce WavTokenizer, which offers several advantages over previous SOTA acoustic codec models in the audio domain: 1)extreme compression. By compressing the layers of quantizers and the temporal dimension of the discrete codec, one-second audio of 24kHz sampling rate requires only a single quantizer with 40 or 75 tokens. 2)improved subjective quality. Despite the reduced number of tokens, WavTokenizer achieves state-of-the-art reconstruction quality with outstanding UTMOS scores and inherently contains richer semantic information. Specifically, we achieve these results by designing a broader VQ space, extended contextual windows, and improved attention networks, as well as introducing a powerful multi-scale discriminator and an inverse Fourier transform structure. We conducted extensive reconstruction experiments in the domains of speech, audio, and music. WavTokenizer exhibited strong performance across various objective and subjective metrics compared to state-of-the-art models. We also tested semantic information, VQ utilization, and adaptability to generative models. Comprehensive ablation studies confirm the necessity of each module in WavTokenizer. The related code, demos, and pre-trained models are available at https://github.com/jishengpeng/WavTokenizer.

چکیده به فارسی (ترجمه ماشینی)

مدل های زبان به طور موثری برای مدل سازی سیگنال های طبیعی مانند تصاویر ، فیلم ، گفتار و صدا استفاده شده است.یک مؤلفه مهم این مدل ها ، رمزگذار Codec است که سیگنال های طبیعی با ابعاد بالا را به نشانه های گسسته با ابعاد پایین تر فشرده می کند.در این مقاله ، ما Wavtokenizer را معرفی می کنیم ، که مزایای بسیاری از مدلهای کدک آکوستیک قبلی SOTA را در حوزه صوتی ارائه می دهد: 1) فشرده سازی شدید.با فشرده سازی لایه های Quantizer و ابعاد زمانی کدک گسسته ، صدای یک ثانیه از میزان نمونه برداری 24KHz فقط به یک مقدار دهنده واحد با 40 یا 75 نشانه نیاز دارد.2) کیفیت ذهنی بهبود یافته.با وجود کاهش تعداد نشانه ها ، Wavtokenizer با نمرات برجسته UTMOS به کیفیت بازسازی پیشرفته می رسد و ذاتاً حاوی اطلاعات معنایی غنی تر است.به طور خاص ، ما با طراحی یک فضای گسترده تر VQ ، ویندوزهای متنی گسترده و شبکه های توجه بهبود یافته و همچنین معرفی یک تبعیض آمیز قدرتمند چند مقیاس و یک ساختار تبدیل فوریه معکوس ، به این نتایج می رسیم.ما آزمایش های بازسازی گسترده ای را در حوزه های گفتار ، صدا و موسیقی انجام دادیم.Wavtokenizer در مقایسه با مدلهای پیشرفته ، عملکرد محکمی را در معیارهای مختلف عینی و ذهنی به نمایش گذاشت.ما همچنین اطلاعات معنایی ، استفاده از VQ و سازگاری با مدلهای تولیدی را آزمایش کردیم.مطالعات جامع فرسایش ضرورت هر ماژول در Wavtokenizer را تأیید می کند.کد مربوط ، نسخه های نمایشی و مدل های از پیش آموزش در https://github.com/jishengpeng/wavtokenizer در دسترس است.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.