ترجمه فارسی مقاله بهینه‌سازی مدل‌های CLIP برای بازیابی تصویر با هم‌ترازی مشترک جاسازی‌شده حفظ شده

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Optimizing CLIP Models for Image Retrieval with Maintained Joint-Embedding Alignment
عنوان مقاله به فارسی بهینه‌سازی مدل‌های CLIP برای بازیابی تصویر با هم‌ترازی مشترک جاسازی‌شده حفظ شده
نویسندگان Konstantin Schall, Kai Uwe Barthel, Nico Hezel, Klaus Jung
فرمت مقاله انگلیسی PDF
تعداد صفحات 18
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computer Vision and Pattern Recognition,Machine Learning,چشم انداز رایانه و تشخیص الگوی , یادگیری ماشین ,
توضیحات Submitted 3 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده در 3 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Contrastive Language and Image Pairing (CLIP), a transformative method in multimedia retrieval, typically trains two neural networks concurrently to generate joint embeddings for text and image pairs. However, when applied directly, these models often struggle to differentiate between visually distinct images that have similar captions, resulting in suboptimal performance for image-based similarity searches. This paper addresses the challenge of optimizing CLIP models for various image-based similarity search scenarios, while maintaining their effectiveness in text-based search tasks such as text-to-image retrieval and zero-shot classification. We propose and evaluate two novel methods aimed at refining the retrieval capabilities of CLIP without compromising the alignment between text and image embeddings. The first method involves a sequential fine-tuning process: initially optimizing the image encoder for more precise image retrieval and subsequently realigning the text encoder to these optimized image embeddings. The second approach integrates pseudo-captions during the retrieval-optimization phase to foster direct alignment within the embedding space. Through comprehensive experiments, we demonstrate that these methods enhance CLIP's performance on various benchmarks, including image retrieval, k-NN classification, and zero-shot text-based classification, while maintaining robustness in text-to-image retrieval. Our optimized models permit maintaining a single embedding per image, significantly simplifying the infrastructure needed for large-scale multi-modal similarity search systems.

چکیده به فارسی (ترجمه ماشینی)

جفت شدن زبان و تصویر متضاد (کلیپ) ، یک روش تحول در بازیابی چندرسانه ای ، به طور معمول دو شبکه عصبی را همزمان برای تولید تعبیه مشترک برای جفت های متن و تصویر آموزش می دهد.با این حال ، هنگامی که به طور مستقیم استفاده می شود ، این مدل ها اغلب برای تمایز بین تصاویر بصری مجزا که دارای زیرنویس های مشابه هستند ، تلاش می کنند ، و در نتیجه عملکرد زیر حداقلی برای جستجوی شباهت مبتنی بر تصویر ایجاد می شود.در این مقاله به چالش بهینه سازی مدل های کلیپ برای سناریوهای مختلف جستجوی شباهت مبتنی بر تصویر می پردازد ، ضمن اینکه اثربخشی آنها را در کارهای جستجوی مبتنی بر متن مانند بازیابی متن به تصویر و طبقه بندی صفر نشان می دهد.ما دو روش جدید با هدف اصلاح قابلیت های بازیابی کلیپ را بدون به خطر انداختن تراز بین متن و تعبیه های تصویر پیشنهاد و ارزیابی می کنیم.روش اول شامل یک فرآیند تنظیم دقیق پی در پی است: در ابتدا بهینه سازی رمزگذار تصویر برای بازیابی دقیق تر تصویر و متعاقباً تنظیم مجدد رمزگذار متن به این تعبیه های بهینه شده تصویر.رویکرد دوم ادغام های شبه در مرحله بازیابی-بهینه سازی برای تقویت تراز مستقیم در فضای تعبیه شده است.از طریق آزمایش های جامع ، ما نشان می دهیم که این روش ها عملکرد کلیپ را در معیارهای مختلف ، از جمله بازیابی تصویر ، طبقه بندی K-NN و طبقه بندی مبتنی بر متن صفر ، ضمن حفظ استحکام در بازیابی متن به تصویر ، افزایش می دهد.مدل های بهینه شده ما اجازه می دهد تا یک تعبیه واحد در هر تصویر را حفظ کنند ، و زیرساخت های مورد نیاز برای سیستم های جستجوی شباهت چند منظوره در مقیاس بزرگ را به طور قابل توجهی ساده می کنند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.