ترجمه فارسی مقاله IAA: معماری آداپتور درونی مدل زبان بزرگ یخ زده را با قابلیت های چند مدلی توانمند می کند

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی IAA: Inner-Adaptor Architecture Empowers Frozen Large Language Model with Multimodal Capabilities
عنوان مقاله به فارسی IAA: معماری آداپتور درونی مدل زبان بزرگ یخ زده را با قابلیت های چند مدلی توانمند می کند
نویسندگان Bin Wang, Chunyu Xie, Dawei Leng, Yuhui Yin
فرمت مقاله انگلیسی PDF
تعداد صفحات 15
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Artificial Intelligence,Computation and Language,Machine Learning,هوش مصنوعی , محاسبات و زبان , یادگیری ماشین ,
توضیحات Submitted 23 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده 23 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

In the field of multimodal large language models (MLLMs), common methods typically involve unfreezing the language model during training to foster profound visual understanding. However, the fine-tuning of such models with vision-language data often leads to a diminution of their natural language processing (NLP) capabilities. To avoid this performance degradation, a straightforward solution is to freeze the language model while developing multimodal competencies. Unfortunately, previous works have not attained satisfactory outcomes. Building on the strategy of freezing the language model, we conduct thorough structural exploration and introduce the Inner-Adaptor Architecture (IAA). Specifically, the architecture incorporates multiple multimodal adaptors at varying depths within the large language model to facilitate direct interaction with the inherently text-oriented transformer layers, thereby enabling the frozen language model to acquire multimodal capabilities. Unlike previous approaches of freezing language models that require large-scale aligned data, our proposed architecture is able to achieve superior performance on small-scale datasets. We conduct extensive experiments to improve the general multimodal capabilities and visual grounding abilities of the MLLM. Our approach remarkably outperforms previous state-of-the-art methods across various vision-language benchmarks without sacrificing performance on NLP tasks. Code and models are available at https://github.com/360CVGroup/Inner-Adaptor-Architecture.

چکیده به فارسی (ترجمه ماشینی)

در زمینه مدلهای زبان بزرگ چندمودال (MLLMS) ، روشهای متداول به طور معمول مستلزم عدم آزمایش مدل زبان در حین آموزش برای تقویت درک عمیق بصری هستند.با این حال ، تنظیم دقیق چنین مدلهایی با داده های بینایی به زبان اغلب منجر به کاهش قابلیت پردازش زبان طبیعی آنها (NLP) می شود.برای جلوگیری از این تخریب عملکرد ، یک راه حل ساده برای یخ زدن مدل زبان در هنگام توسعه شایستگی های چندمودالی است.متأسفانه ، آثار قبلی به نتایج رضایت بخش نرسیده اند.با تکیه بر استراتژی انجماد مدل زبان ، ما اکتشافات ساختاری کاملی را انجام می دهیم و معماری داخلی آداپتور (IAA) را معرفی می کنیم.به طور خاص ، این معماری شامل چندین آداپتورهای چند حالته در اعماق مختلف در مدل زبان بزرگ برای تسهیل تعامل مستقیم با لایه های ترانسفورماتور ذاتاً متن گرا است ، در نتیجه مدل زبان یخ زده را قادر می سازد تا قابلیت های چند مدلی را بدست آورد.بر خلاف رویکردهای قبلی مدل های زبان انجماد که به داده های تراز شده در مقیاس بزرگ نیاز دارند ، معماری پیشنهادی ما قادر به دستیابی به عملکرد برتر در مجموعه داده های در مقیاس کوچک است.ما آزمایش های گسترده ای را برای بهبود قابلیت های چند حالته عمومی و توانایی های زمینی بصری MLLM انجام می دهیم.رویکرد ما به طرز چشمگیری از روشهای پیشرفته قبلی در معیارهای مختلف بینایی به زبان بدون قربانی کردن عملکرد در کارهای NLP بهتر عمل می کند.کد و مدل ها در https://github.com/360cvgroup/inner-adaptor-architecture در دسترس هستند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.