ترجمه فارسی مقاله افزایش تولید تصویر مشروط با دستکاری فضای پنهان قابل توضیح

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Enhancing Conditional Image Generation with Explainable Latent Space Manipulation
عنوان مقاله به فارسی افزایش تولید تصویر مشروط با دستکاری فضای پنهان قابل توضیح
نویسندگان Kshitij Pathania
فرمت مقاله انگلیسی PDF
تعداد صفحات 7
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computer Vision and Pattern Recognition,Artificial Intelligence,Machine Learning,چشم انداز رایانه و تشخیص الگوی , هوش مصنوعی , یادگیری ماشین ,
توضیحات Submitted 28 August, 2024; originally announced August 2024. , Comments: 7 pages , 5 figures , MSC Class: 26B10; 53A35; ACM Class: I.2.10; I.4.10
توضیحات به فارسی ارسال شده 28 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد ، نظرات: 7 صفحه ، 5 شکل ، کلاس MSC: 26B10 ؛53a35 ؛کلاس ACM: I.2.10 ؛I.4.10
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

In the realm of image synthesis, achieving fidelity to a reference image while adhering to conditional prompts remains a significant challenge. This paper proposes a novel approach that integrates a diffusion model with latent space manipulation and gradient-based selective attention mechanisms to address this issue. Leveraging Grad-SAM (Gradient-based Selective Attention Manipulation), we analyze the cross attention maps of the cross attention layers and gradients for the denoised latent vector, deriving importance scores of elements of denoised latent vector related to the subject of interest. Using this information, we create masks at specific timesteps during denoising to preserve subjects while seamlessly integrating the reference image features. This approach ensures the faithful formation of subjects based on conditional prompts, while concurrently refining the background for a more coherent composition. Our experiments on places365 dataset demonstrate promising results, with our proposed model achieving the lowest mean and median Frechet Inception Distance (FID) scores compared to baseline models, indicating superior fidelity preservation. Furthermore, our model exhibits competitive performance in aligning the generated images with provided textual descriptions, as evidenced by high CLIP scores. These results highlight the effectiveness of our approach in both fidelity preservation and textual context preservation, offering a significant advancement in text-to-image synthesis tasks.

چکیده به فارسی (ترجمه ماشینی)

در قلمرو سنتز تصویر ، دستیابی به وفاداری به یک تصویر مرجع در حالی که به پیروی از شرط های مشروط ، یک چالش مهم است.این مقاله یک رویکرد جدید را ارائه می دهد که یک مدل انتشار را با دستکاری فضایی نهفته و مکانیسم های توجه انتخابی مبتنی بر گرادیان برای رسیدگی به این مسئله ادغام می کند.اهرم Grad-SAM (دستکاری انتخابی انتخابی مبتنی بر گرادیان) ، ما نقشه های توجه متقاطع لایه های توجه متقابل و شیب برای بردار نهفته denoized را تجزیه و تحلیل می کنیم ، و نمرات اهمیت عناصر بردار نهفته دلخراش مربوط به موضوع مورد علاقه را به دست می آوریم.با استفاده از این اطلاعات ، ما در حین دلهره ماسک هایی را در زمان های خاص ایجاد می کنیم تا افراد را حفظ کنیم و در عین حال یکپارچه ویژگی های تصویر مرجع را ادغام کنیم.این رویکرد ، شکل گیری وفادار افراد را بر اساس پیشبردهای مشروط تضمین می کند ، در حالی که همزمان پیش زمینه را برای یک ترکیب منسجم تر می کند.آزمایشات ما در مجموعه داده های Places365 نتایج امیدوارکننده را نشان می دهد ، با مدل پیشنهادی ما که به پایین ترین میانگین و میانگین نمرات فاصله Frechet (FID) در مقایسه با مدل های پایه دست می یابد ، و این نشانگر حفظ وفاداری برتر است.علاوه بر این ، مدل ما عملکرد رقابتی را در تراز کردن تصاویر تولید شده با توضیحات متنی ارائه شده نشان می دهد ، همانطور که توسط نمرات کلیپ بالا مشهود است.این نتایج اثربخشی رویکرد ما در حفظ وفاداری و حفظ زمینه متنی را برجسته می کند و پیشرفت قابل توجهی در کارهای سنتز متن به تصویر ارائه می دهد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.