ترجمه فارسی مقاله Video-Foley: تولید ویدئو به صدا دو مرحله ای از طریق شرایط رویداد موقت برای صدای فولی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

عنوان مقاله به انگلیسی Video-Foley: Two-Stage Video-To-Sound Generation via Temporal Event Condition For Foley Sound
عنوان مقاله به فارسی Video-Foley: تولید ویدئو به صدا دو مرحله ای از طریق شرایط رویداد موقت برای صدای فولی
نویسندگان Junwon Lee, Jaekwon Im, Dabin Kim, Juhan Nam
فرمت مقاله انگلیسی PDF
تعداد صفحات 11
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Sound,Computer Vision and Pattern Recognition,Machine Learning,Multimedia,Audio and Speech Processing,صدا , دید رایانه و تشخیص الگوی , یادگیری ماشین , چندرسانه ای , پردازش صوتی و گفتار ,
توضیحات Submitted 21 August, 2024; originally announced August 2024.
توضیحات به فارسی ارائه شده 21 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Foley sound synthesis is crucial for multimedia production, enhancing user experience by synchronizing audio and video both temporally and semantically. Recent studies on automating this labor-intensive process through video-to-sound generation face significant challenges. Systems lacking explicit temporal features suffer from poor controllability and alignment, while timestamp-based models require costly and subjective human annotation. We propose Video-Foley, a video-to-sound system using Root Mean Square (RMS) as a temporal event condition with semantic timbre prompts (audio or text). RMS, a frame-level intensity envelope feature closely related to audio semantics, ensures high controllability and synchronization. The annotation-free self-supervised learning framework consists of two stages, Video2RMS and RMS2Sound, incorporating novel ideas including RMS discretization and RMS-ControlNet with a pretrained text-to-audio model. Our extensive evaluation shows that Video-Foley achieves state-of-the-art performance in audio-visual alignment and controllability for sound timing, intensity, timbre, and nuance. Code, model weights, and demonstrations are available on the accompanying website. (https://jnwnlee.github.io/video-foley-demo)

چکیده به فارسی (ترجمه ماشینی)

سنتز صدا Foley برای تولید چندرسانه ای بسیار مهم است و تجربه کاربر را با همگام سازی صوتی و تصویری هم به صورت موقت و معنایی تقویت می کند.مطالعات اخیر در مورد اتوماسیون این فرآیند فشرده کار از طریق نسل ویدئویی به صدا با چالش های مهمی روبرو است.سیستم هایی که فاقد ویژگی های زمانی صریح هستند از کنترل و تراز ضعیف رنج می برند ، در حالی که مدل های مبتنی بر Timestamp نیاز به حاشیه نویسی انسانی پر هزینه و ذهنی دارند.ما ویدیویی فولی را پیشنهاد می کنیم ، یک سیستم ویدئویی به صدا با استفاده از میانگین مربع Root (RMS) به عنوان یک وضعیت رویداد زمانی با تعهدات معنایی Timbre (صوتی یا متن).RMS ، یک ویژگی پاکت با شدت قاب که از نزدیک با معناشناسی صوتی مرتبط است ، کنترل و هماهنگ سازی بالا را تضمین می کند.چارچوب یادگیری خودكاری بدون حاشیه نویسی شامل دو مرحله ، Video2RMS و RMS2Sound است كه شامل ایده های جدید از جمله گسسته سازی RMS و Controlnet RMS با مدل متن به Audio است.ارزیابی گسترده ما نشان می دهد که فولی های ویدئویی به عملکرد پیشرفته در تراز صوتی و تصویری و کنترل پذیری برای زمان بندی صدا ، شدت ، تایم و ظرافت دست می یابند.کد ، وزن مدل و تظاهرات در وب سایت همراه موجود است.(https://jnwnlee.github.io/video-foley-demo)

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.