ترجمه فارسی مقاله استدلال بصری صفر شات توسط مدل‌های زبان بینایی: محک‌گذاری و تحلیل

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
عنوان مقاله به فارسی استدلال بصری صفر شات توسط مدل‌های زبان بینایی: محک‌گذاری و تحلیل
نویسندگان Aishik Nagar, Shantanu Jaiswal, Cheston Tan
فرمت مقاله انگلیسی PDF
تعداد صفحات 21
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computation and Language,Artificial Intelligence,Computer Vision and Pattern Recognition,Machine Learning,محاسبات و زبان , هوش مصنوعی , چشم انداز رایانه و تشخیص الگوی , یادگیری ماشین ,
توضیحات Submitted 27 August, 2024; originally announced September 2024. , Comments: 21 pages
توضیحات به فارسی ارسال شده در 27 اوت 2024 ؛در ابتدا سپتامبر 2024 اعلام شد ، نظرات: 21 صفحه
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Vision-language models (VLMs) have shown impressive zero- and few-shot performance on real-world visual question answering (VQA) benchmarks, alluding to their capabilities as visual reasoning engines. However, the benchmarks being used conflate "pure" visual reasoning with world knowledge, and also have questions that involve a limited number of reasoning steps. Thus, it remains unclear whether a VLM's apparent visual reasoning performance is due to its world knowledge, or due to actual visual reasoning capabilities. To clarify this ambiguity, we systematically benchmark and dissect the zero-shot visual reasoning capabilities of VLMs through synthetic datasets that require minimal world knowledge, and allow for analysis over a broad range of reasoning steps. We focus on two novel aspects of zero-shot visual reasoning: i) evaluating the impact of conveying scene information as either visual embeddings or purely textual scene descriptions to the underlying large language model (LLM) of the VLM, and ii) comparing the effectiveness of chain-of-thought prompting to standard prompting for zero-shot visual reasoning. We find that the underlying LLMs, when provided textual scene descriptions, consistently perform better compared to being provided visual embeddings. In particular, 18% higher accuracy is achieved on the PTR dataset. We also find that CoT prompting performs marginally better than standard prompting only for the comparatively large GPT-3.5-Turbo (175B) model, and does worse for smaller-scale models. This suggests the emergence of CoT abilities for visual reasoning in LLMs at larger scales even when world knowledge is limited. Overall, we find limitations in the abilities of VLMs and LLMs for more complex visual reasoning, and highlight the important role that LLMs can play in visual reasoning.

چکیده به فارسی (ترجمه ماشینی)

مدلهای بینایی-زبان (VLM) عملکرد چشمگیر صفر و چند عکس را در معیارهای پاسخگویی به سؤال بصری در دنیای واقعی (VQA) نشان داده اند و به توانایی های آنها به عنوان موتورهای استدلال بصری اشاره دارند.با این حال ، معیارهای استفاده شده با دانش جهانی استدلال "خالص" را با هم در هم می آمیزند ، و همچنین سؤالاتی دارند که تعداد محدودی از مراحل استدلال را شامل می شود.بنابراین ، هنوز مشخص نیست که آیا عملکرد استدلال بصری ظاهری VLM به دلیل دانش جهانی آن است یا به دلیل توانایی واقعی استدلال بصری.برای روشن شدن این ابهام ، ما به طور سیستماتیک قابلیت های استدلال بصری صفر را از طریق مجموعه داده های مصنوعی که به دانش حداقل جهان نیاز دارند ، معیار و جدا می کنیم و امکان تجزیه و تحلیل را در طیف گسترده ای از مراحل استدلال فراهم می کنیم.ما روی دو جنبه جدید استدلال بصری صفر تمرکز می کنیم: i) ارزیابی تأثیر انتقال اطلاعات صحنه به عنوان تعبیه بصری یا توضیحات صحنه کاملاً متنی با مدل زبان بزرگ اساسی (LLM) VLM و II) مقایسه اثربخشیاز زنجیره ای از فکر به فرکانس استاندارد برای استدلال بصری صفر.ما می دانیم که LLM های زیرین ، هنگامی که توضیحات صحنه متنی ارائه شده است ، به طور مداوم عملکرد بهتری در مقایسه با تعبیه بصری دارند.به طور خاص ، 18 ٪ دقت بالاتر در مجموعه داده PTR حاصل می شود.ما همچنین می یابیم که COT فوری عملکرد حاشیه ای بهتر از استاندارد را فقط برای مدل GPT-5.5 توربو (175b) نسبتاً بزرگ انجام می دهد و برای مدل های در مقیاس کوچکتر بدتر می شود.این حاکی از ظهور توانایی های COT برای استدلال بصری در LLM ها در مقیاس های بزرگتر حتی اگر دانش جهانی محدود باشد.به طور کلی ، ما در توانایی های VLMS و LLMS برای استدلال بصری پیچیده تر ، محدودیت هایی را می یابیم و نقش مهمی را که LLM ها می توانند در استدلال بصری ایفا کنند ، برجسته می کنیم.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.