ترجمه فارسی مقاله یادگیری فشرده سازی زمینه ها برای پاسخ به سؤال بصری مبتنی بر دانش کارآمد

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Learning to Compress Contexts for Efficient Knowledge-based Visual Question Answering
عنوان مقاله به فارسی یادگیری فشرده سازی زمینه ها برای پاسخ به سؤال بصری مبتنی بر دانش کارآمد
نویسندگان Weixi Weng, Jieming Zhu, Hao Zhang, Xiaojun Meng, Rui Zhang, Chun Yuan
فرمت مقاله انگلیسی PDF
تعداد صفحات 9
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computer Vision and Pattern Recognition,Machine Learning,چشم انداز رایانه و تشخیص الگوی , یادگیری ماشین ,
توضیحات Submitted 11 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده در 11 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Multimodal Large Language Models (MLLMs) have demonstrated great zero-shot performance on visual question answering (VQA). However, when it comes to knowledge-based VQA (KB-VQA), MLLMs may lack human commonsense or specialized domain knowledge to answer such questions and require obtaining necessary information from external knowledge sources. Previous works like Retrival-Augmented VQA-v2 (RAVQA-v2) focus on utilizing as much input information, such as image-based textual descriptions and retrieved knowledge, as possible to improve performance, but they all overlook the issue that with the number of input tokens increasing, inference efficiency significantly decreases, which contradicts the demands of practical applications. To address this issue, we propose Retrieval-Augmented MLLM with Compressed Contexts (RACC). RACC learns to compress and aggregate retrieved contexts, from which it generates a compact modulation in the form of Key-Value (KV) cache. This modulation is then used to adapt the downstream frozen MLLM, thereby achieving effective and efficient inference. RACC achieves a state-of-the-art (SOTA) performance of 62.9% on OK-VQA. Moreover, it significantly reduces inference latency by 22.0%-59.7% compared to the prominent RAVQA-v2. Abundant experiments show RACC's broad applicability. It is compatible with various off-the-shelf MLLMs and can also handle different knowledge sources including textual and multimodal documents.

چکیده به فارسی (ترجمه ماشینی)

مدل های بزرگ زبان چند حالته (MLLMS) عملکرد صفر عالی را در پاسخ به سؤال بصری (VQA) نشان داده اند.با این حال ، هنگامی که صحبت از VQA مبتنی بر دانش (KB-VQA) می شود ، MLLMS ممکن است برای پاسخ به چنین سؤالاتی فاقد دانش دامنه انسانی یا تخصصی باشد.آثار قبلی مانند VQA-V2 (RAVQA-V2) با استفاده از اطلاعات ورودی به همان اندازه اطلاعات ورودی ، مانند توضیحات متنی مبتنی بر تصویر و دانش بازیابی شده ، تا حد امکان برای بهبود عملکرد متمرکز شده اند ، اما همه آنها از این مسئله غافل می شوند که با تعداد تعدادنشانه های ورودی افزایش می یابد ، راندمان استنباط به طور قابل توجهی کاهش می یابد ، که با خواسته های کاربردهای عملی مغایرت دارد.برای پرداختن به این مسئله ، ما MLLM با بازیابی را با زمینه های فشرده شده (RACC) پیشنهاد می کنیم.RACC می آموزد که زمینه های بازیابی شده را فشرده و جمع کند ، که از آن یک مدولاسیون جمع و جور به شکل حافظه نهان با ارزش کلیدی (KV) ایجاد می کند.این مدولاسیون سپس برای تطبیق MLLM یخ زده پایین دست استفاده می شود و از این طریق به استنتاج مؤثر و کارآمد می رسد.RACC به عملکرد پیشرفته (SOTA) 62.9 ٪ در OK-VQA دست پیدا می کند.علاوه بر این ، این میزان تأخیر استنباط را 22.0 ٪ -59.7 ٪ در مقایسه با برجسته RAVQA-V2 کاهش می دهد.آزمایشات فراوان ، کاربرد گسترده RACC را نشان می دهد.این سازگار با MLLM های مختلف خارج از قفسه است و همچنین می تواند منابع مختلف دانش از جمله اسناد متنی و چندمودالی را اداره کند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.