ترجمه فارسی مقاله Eagle: کاوش در فضای طراحی برای LLM های چندوجهی با ترکیبی از رمزگذارها

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders
عنوان مقاله به فارسی Eagle: کاوش در فضای طراحی برای LLM های چندوجهی با ترکیبی از رمزگذارها
نویسندگان Min Shi, Fuxiao Liu, Shihao Wang, Shijia Liao, Subhashree Radhakrishnan, De-An Huang, Hongxu Yin, Karan Sapra, Yaser Yacoob, Humphrey Shi, Bryan Catanzaro, Andrew Tao, Jan Kautz, Zhiding Yu, Guilin Liu
فرمت مقاله انگلیسی PDF
تعداد صفحات 16
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computer Vision and Pattern Recognition,Artificial Intelligence,Machine Learning,Robotics,چشم انداز رایانه و تشخیص الگوی , هوش مصنوعی , یادگیری ماشین , روباتیک ,
توضیحات Submitted 28 August, 2024; originally announced August 2024. , Comments: Github: https://github.com/NVlabs/Eagle, HuggingFace: https://huggingface.co/NVEagle
توضیحات به فارسی ارسال شده 28 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد. ، نظرات: github: https://github.com/nvlabs/eagle ، Huggingface: https://huggingface.co/nveagle
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

The ability to accurately interpret complex visual information is a crucial topic of multimodal large language models (MLLMs). Recent work indicates that enhanced visual perception significantly reduces hallucinations and improves performance on resolution-sensitive tasks, such as optical character recognition and document analysis. A number of recent MLLMs achieve this goal using a mixture of vision encoders. Despite their success, there is a lack of systematic comparisons and detailed ablation studies addressing critical aspects, such as expert selection and the integration of multiple vision experts. This study provides an extensive exploration of the design space for MLLMs using a mixture of vision encoders and resolutions. Our findings reveal several underlying principles common to various existing strategies, leading to a streamlined yet effective design approach. We discover that simply concatenating visual tokens from a set of complementary vision encoders is as effective as more complex mixing architectures or strategies. We additionally introduce Pre-Alignment to bridge the gap between vision-focused encoders and language tokens, enhancing model coherence. The resulting family of MLLMs, Eagle, surpasses other leading open-source models on major MLLM benchmarks. Models and code: https://github.com/NVlabs/Eagle

چکیده به فارسی (ترجمه ماشینی)

توانایی تفسیر دقیق اطلاعات بصری پیچیده ، موضوع مهمی از مدل های بزرگ زبان چندرسانه ای (MLLMS) است.کار اخیر نشان می دهد که ادراک بصری افزایش یافته به طور قابل توجهی توهم را کاهش می دهد و عملکرد در کارهای حساس به وضوح مانند تشخیص شخصیت نوری و تجزیه و تحلیل اسناد را بهبود می بخشد.تعدادی از MLLM های اخیر با استفاده از ترکیبی از رمزگذارهای بینایی به این هدف دست می یابند.علیرغم موفقیت آنها ، فقدان مقایسه سیستماتیک و مطالعات دقیق فرسایش در مورد جنبه های مهم ، مانند انتخاب متخصص و ادغام کارشناسان چند دید وجود دارد.این مطالعه با استفاده از ترکیبی از رمزگذارهای بینایی و وضوح ، اکتشاف گسترده ای از فضای طراحی برای MLLM ها را ارائه می دهد.یافته های ما چندین اصل اساسی را که برای استراتژی های مختلف موجود مشترک است ، نشان می دهد و منجر به یک رویکرد طراحی ساده و در عین حال مؤثر می شود.ما می دانیم که به سادگی در هماهنگی نشانه های بصری از مجموعه ای از رمزگذارهای دید مکمل به همان اندازه معماری یا استراتژی های مخلوط پیچیده تر مؤثر است.علاوه بر این ، ما قبل از تابلوی را برای ایجاد شکاف بین رمزگذارهای متمرکز بر بینایی و نشانه های زبان معرفی می کنیم و انسجام مدل را تقویت می کنیم.خانواده حاصل از MLLMS ، Eagle ، از سایر مدل های پیشرو منبع باز در معیارهای اصلی MLLM پیشی می گیرد.مدل ها و کد: https://github.com/nvlabs/eagle

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.