ترجمه فارسی مقاله SortFormer: یکپارچه سازی یکپارچه سازی دیاری شدن بلندگو و ASR با پل زدن به وقت و نشانه ها

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Sortformer: Seamless Integration of Speaker Diarization and ASR by Bridging Timestamps and Tokens
عنوان مقاله به فارسی SortFormer: یکپارچه سازی یکپارچه سازی دیاری شدن بلندگو و ASR با پل زدن به وقت و نشانه ها
نویسندگان Taejin Park, Ivan Medennikov, Kunal Dhawan, Weiqing Wang, He Huang, Nithin Rao Koluguri, Krishna C. Puvvada, Jagadeesh Balam, Boris Ginsburg
فرمت مقاله انگلیسی PDF
تعداد صفحات 17
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Audio and Speech Processing,Computation and Language,Machine Learning,Sound,پردازش صوتی و گفتار , محاسبه و زبان , یادگیری ماشین , صدا ,
توضیحات Submitted 10 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده 10 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

We propose Sortformer, a novel neural model for speaker diarization, trained with unconventional objectives compared to existing end-to-end diarization models. The permutation problem in speaker diarization has long been regarded as a critical challenge. Most prior end-to-end diarization systems employ permutation invariant loss (PIL), which optimizes for the permutation that yields the lowest error. In contrast, we introduce Sort Loss, which enables a diarization model to autonomously resolve permutation, with or without PIL. We demonstrate that combining Sort Loss and PIL achieves performance competitive with state-of-the-art end-to-end diarization models trained exclusively with PIL. Crucially, we present a streamlined multispeaker ASR architecture that leverages Sortformer as a speaker supervision model, embedding speaker label estimation within the ASR encoder state using a sinusoidal kernel function. This approach resolves the speaker permutation problem through sorted objectives, effectively bridging speaker-label timestamps and speaker tokens. In our experiments, we show that the proposed multispeaker ASR architecture, enhanced with speaker supervision, improves performance via adapter techniques. Code and trained models will be made publicly available via the NVIDIA NeMo framework

چکیده به فارسی (ترجمه ماشینی)

ما SortFormer ، یک مدل عصبی جدید برای دیابت بلندگو ، که با اهداف غیر متعارف در مقایسه با مدل های موجود در انتهای موجود ، آموزش دیده است ، پیشنهاد می کنیم.مشکل جابجایی در دیافراگم بلندگو مدتهاست که به عنوان یک چالش مهم در نظر گرفته شده است.بیشتر سیستم های دیافراگم پایان به پایان ، از دست دادن تغییر ناپذیر (PIL) استفاده می کنند ، که برای جابجایی که کمترین خطا را به همراه دارد ، بهینه می شود.در مقابل ، ما از دست دادن مرتب سازی ، که یک مدل دیاریراسیون را قادر می سازد تا به طور مستقل جای خود را با یا بدون PIL برطرف کند.ما نشان می دهیم که ترکیب با از دست دادن مرتب سازی و PIL به عملکرد رقابت با مدلهای پیشرفته و پیشرفته از پایان به پایان می رسد که به طور انحصاری با PIL آموزش دیده است.از نظر مهم ، ما یک معماری ASR چندپایی ساده را ارائه می دهیم که به عنوان یک مدل نظارت بر بلندگو ، مرتب سازی را به دست می آورد و تخمین برچسب بلندگو را در حالت رمزگذار ASR با استفاده از یک عملکرد هسته سینوسی جاسازی می کند.این رویکرد مشکل جابجایی بلندگو را از طریق اهداف مرتب شده برطرف می کند ، و به طور موثری پل زدن زمان سنج بلندگو و نشانه های بلندگو را برطرف می کند.در آزمایشات ما ، ما نشان می دهیم که معماری ASR Multipeaker پیشنهادی ، با نظارت بلندگو ، عملکرد را از طریق تکنیک های آداپتور بهبود می بخشد.کد و مدلهای آموزش دیده از طریق چارچوب NVIDIA NEMO در دسترس عموم قرار می گیرند

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.