ترجمه فارسی مقاله بهینه‌سازی تعداد شی تکراری برای مدل‌های انتشار متن به تصویر

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

عنوان مقاله به انگلیسی Iterative Object Count Optimization for Text-to-image Diffusion Models
عنوان مقاله به فارسی بهینه‌سازی تعداد شی تکراری برای مدل‌های انتشار متن به تصویر
نویسندگان Oz Zafar, Lior Wolf, Idan Schwartz
فرمت مقاله انگلیسی PDF
تعداد صفحات 13
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computer Vision and Pattern Recognition,Artificial Intelligence,Graphics,Machine Learning,چشم انداز رایانه و تشخیص الگوی , هوش مصنوعی , گرافیک , یادگیری ماشین ,
توضیحات Submitted 21 August, 2024; originally announced August 2024. , Comments: Pre-print
توضیحات به فارسی ارائه شده 21 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد. ، نظرات: پیش چاپ
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

We address a persistent challenge in text-to-image models: accurately generating a specified number of objects. Current models, which learn from image-text pairs, inherently struggle with counting, as training data cannot depict every possible number of objects for any given object. To solve this, we propose optimizing the generated image based on a counting loss derived from a counting model that aggregates an objectś potential. Employing an out-of-the-box counting model is challenging for two reasons: first, the model requires a scaling hyperparameter for the potential aggregation that varies depending on the viewpoint of the objects, and second, classifier guidance techniques require modified models that operate on noisy intermediate diffusion steps. To address these challenges, we propose an iterated online training mode that improves the accuracy of inferred images while altering the text conditioning embedding and dynamically adjusting hyperparameters. Our method offers three key advantages: (i) it can consider non-derivable counting techniques based on detection models, (ii) it is a zero-shot plug-and-play solution facilitating rapid changes to the counting techniques and image generation methods, and (iii) the optimized counting token can be reused to generate accurate images without additional optimization. We evaluate the generation of various objects and show significant improvements in accuracy. The project page is available at https://ozzafar.github.io/count_token.

چکیده به فارسی (ترجمه ماشینی)

ما یک چالش مداوم در مدل های متن به تصویر را برطرف می کنیم: به طور دقیق تعداد مشخصی از اشیاء را تولید می کنیم.مدل های فعلی ، که از جفت های متن تصویر می آموزند ، ذاتاً با شمارش مبارزه می کنند ، زیرا داده های آموزش نمی توانند هر تعداد ممکن از اشیاء را برای هر شیء معین نشان دهند.برای حل این مسئله ، ما بهینه سازی تصویر تولید شده را بر اساس ضرر شمارش حاصل از یک مدل شمارش که یک پتانسیل Objectś را جمع می کند ، پیشنهاد می کنیم.استفاده از یک مدل شمارش خارج از جعبه به دو دلیل چالش برانگیز است: اول ، این مدل برای تجمع بالقوه نیاز به یکپرپارامتر مقیاس پذیر دارد که بسته به دیدگاه اشیاء متفاوت است و تکنیک های راهنمایی طبقه بندی کننده دوم نیاز به مدل های اصلاح شده ای دارند که کار می کننددر مراحل انتشار میانی پر سر و صدا.برای پرداختن به این چالش ها ، ما یک حالت آموزش آنلاین تکرار شده را پیشنهاد می کنیم که ضمن تغییر در تعبیه تهویه متن و تنظیم پویا ، HyperParameters ، دقت تصاویر استنباط شده را بهبود می بخشد.روش ما سه مزیت اصلی را ارائه می دهد: (i) می تواند تکنیک های شمارش غیر قابل شمارش را بر اساس مدل های تشخیص در نظر بگیرد ، (ب) این یک راه حل پلاگین و بازی صفر است که باعث تغییر سریع در تکنیک های شمارش و روش های تولید تصویر می شود ،و (iii) نشانه شمارش بهینه شده را می توان برای تولید تصاویر دقیق بدون بهینه سازی اضافی استفاده کرد.ما تولید اشیاء مختلف را ارزیابی می کنیم و پیشرفت های قابل توجهی در دقت نشان می دهیم.صفحه پروژه در https://ozzafar.github.io/count_token در دسترس است.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.