Computation and Language,Artificial Intelligence,Computer Vision and Pattern Recognition,Machine Learning,محاسبات و زبان , هوش مصنوعی , چشم انداز رایانه و تشخیص الگوی , یادگیری ماشین ,
توضیحات
Submitted 27 August, 2024; originally announced September 2024. , Comments: 21 pages
توضیحات به فارسی
ارسال شده در 27 اوت 2024 ؛در ابتدا سپتامبر 2024 اعلام شد ، نظرات: 21 صفحه
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs
چکیده
Vision-language models (VLMs) have shown impressive zero- and few-shot performance on real-world visual question answering (VQA) benchmarks, alluding to their capabilities as visual reasoning engines. However, the benchmarks being used conflate "pure" visual reasoning with world knowledge, and also have questions that involve a limited number of reasoning steps. Thus, it remains unclear whether a VLM's apparent visual reasoning performance is due to its world knowledge, or due to actual visual reasoning capabilities. To clarify this ambiguity, we systematically benchmark and dissect the zero-shot visual reasoning capabilities of VLMs through synthetic datasets that require minimal world knowledge, and allow for analysis over a broad range of reasoning steps. We focus on two novel aspects of zero-shot visual reasoning: i) evaluating the impact of conveying scene information as either visual embeddings or purely textual scene descriptions to the underlying large language model (LLM) of the VLM, and ii) comparing the effectiveness of chain-of-thought prompting to standard prompting for zero-shot visual reasoning. We find that the underlying LLMs, when provided textual scene descriptions, consistently perform better compared to being provided visual embeddings. In particular, 18% higher accuracy is achieved on the PTR dataset. We also find that CoT prompting performs marginally better than standard prompting only for the comparatively large GPT-3.5-Turbo (175B) model, and does worse for smaller-scale models. This suggests the emergence of CoT abilities for visual reasoning in LLMs at larger scales even when world knowledge is limited. Overall, we find limitations in the abilities of VLMs and LLMs for more complex visual reasoning, and highlight the important role that LLMs can play in visual reasoning.
چکیده به فارسی (ترجمه ماشینی)
مدلهای بینایی-زبان (VLM) عملکرد چشمگیر صفر و چند عکس را در معیارهای پاسخگویی به سؤال بصری در دنیای واقعی (VQA) نشان داده اند و به توانایی های آنها به عنوان موتورهای استدلال بصری اشاره دارند.با این حال ، معیارهای استفاده شده با دانش جهانی استدلال "خالص" را با هم در هم می آمیزند ، و همچنین سؤالاتی دارند که تعداد محدودی از مراحل استدلال را شامل می شود.بنابراین ، هنوز مشخص نیست که آیا عملکرد استدلال بصری ظاهری VLM به دلیل دانش جهانی آن است یا به دلیل توانایی واقعی استدلال بصری.برای روشن شدن این ابهام ، ما به طور سیستماتیک قابلیت های استدلال بصری صفر را از طریق مجموعه داده های مصنوعی که به دانش حداقل جهان نیاز دارند ، معیار و جدا می کنیم و امکان تجزیه و تحلیل را در طیف گسترده ای از مراحل استدلال فراهم می کنیم.ما روی دو جنبه جدید استدلال بصری صفر تمرکز می کنیم: i) ارزیابی تأثیر انتقال اطلاعات صحنه به عنوان تعبیه بصری یا توضیحات صحنه کاملاً متنی با مدل زبان بزرگ اساسی (LLM) VLM و II) مقایسه اثربخشیاز زنجیره ای از فکر به فرکانس استاندارد برای استدلال بصری صفر.ما می دانیم که LLM های زیرین ، هنگامی که توضیحات صحنه متنی ارائه شده است ، به طور مداوم عملکرد بهتری در مقایسه با تعبیه بصری دارند.به طور خاص ، 18 ٪ دقت بالاتر در مجموعه داده PTR حاصل می شود.ما همچنین می یابیم که COT فوری عملکرد حاشیه ای بهتر از استاندارد را فقط برای مدل GPT-5.5 توربو (175b) نسبتاً بزرگ انجام می دهد و برای مدل های در مقیاس کوچکتر بدتر می شود.این حاکی از ظهور توانایی های COT برای استدلال بصری در LLM ها در مقیاس های بزرگتر حتی اگر دانش جهانی محدود باشد.به طور کلی ، ما در توانایی های VLMS و LLMS برای استدلال بصری پیچیده تر ، محدودیت هایی را می یابیم و نقش مهمی را که LLM ها می توانند در استدلال بصری ایفا کنند ، برجسته می کنیم.
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs