ترجمه فارسی مقاله فشار دادن محدودیت های مدل های بینایی زبان در سنجش از دور و بدون حاشیه نویسی انسانی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Pushing the Limits of Vision-Language Models in Remote Sensing without Human Annotations
عنوان مقاله به فارسی فشار دادن محدودیت های مدل های بینایی زبان در سنجش از دور و بدون حاشیه نویسی انسانی
نویسندگان Keumgang Cha, Donggeun Yu, Junghoon Seo
فرمت مقاله انگلیسی PDF
تعداد صفحات 5
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computer Vision and Pattern Recognition,چشم انداز رایانه و تشخیص الگوی ,
توضیحات Submitted 11 September, 2024; originally announced September 2024. , Comments: This study was primarily conducted during the latter half of 2023
توضیحات به فارسی ارسال شده در 11 سپتامبر 2024 ؛در ابتدا در سپتامبر 2024 اعلام شد. ، نظرات: این مطالعه در درجه اول در نیمه دوم سال 2023 انجام شد
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

The prominence of generalized foundation models in vision-language integration has witnessed a surge, given their multifarious applications. Within the natural domain, the procurement of vision-language datasets to construct these foundation models is facilitated by their abundant availability and the ease of web crawling. Conversely, in the remote sensing domain, although vision-language datasets exist, their volume is suboptimal for constructing robust foundation models. This study introduces an approach to curate vision-language datasets by employing an image decoding machine learning model, negating the need for human-annotated labels. Utilizing this methodology, we amassed approximately 9.6 million vision-language paired datasets in VHR imagery. The resultant model outperformed counterparts that did not leverage publicly available vision-language datasets, particularly in downstream tasks such as zero-shot classification, semantic localization, and image-text retrieval. Moreover, in tasks exclusively employing vision encoders, such as linear probing and k-NN classification, our model demonstrated superior efficacy compared to those relying on domain-specific vision-language datasets.

چکیده به فارسی (ترجمه ماشینی)

برجستگی مدلهای بنیاد عمومی در ادغام بینایی زبان ، با توجه به کاربردهای چندگانه آنها ، شاهد افزایش بوده است.در حوزه طبیعی ، تهیه مجموعه داده های بینایی زبان برای ساخت این مدل های پایه با در دسترس بودن فراوان و سهولت خزیدن وب تسهیل می شود.در مقابل ، در حوزه سنجش از راه دور ، اگرچه مجموعه داده های بینایی زبان وجود دارد ، حجم آنها برای ساخت مدلهای بنیادی قوی پایین است.این مطالعه با استفاده از یک مدل یادگیری ماشین رمزگشایی تصویر ، رویکردی را برای تنظیم مجموعه داده های بینایی به زبان ارائه می دهد و نیاز به برچسب های ناتوان از انسان را نفی می کند.با استفاده از این روش ، ما تقریباً 9.6 میلیون مجموعه داده زوجی به زبان بینایی را در تصاویر VHR جمع آوری کردیم.مدل حاصل از همتایان فراتر از همتایان که از مجموعه داده های دیدنی در دسترس عموم استفاده نمی کند ، به ویژه در کارهای پایین دست مانند طبقه بندی صفر-شات ، محلی سازی معنایی و بازیابی متن تصویر.علاوه بر این ، در کارهایی که منحصراً از رمزگذارهای بینایی استفاده می کنند ، مانند کاوش خطی و طبقه بندی K-NN ، مدل ما اثربخشی برتر را در مقایسه با تکیه بر مجموعه داده های زیست چشم انداز خاص دامنه نشان داد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.