ترجمه فارسی مقاله LLaVA-NeXT-Interleave: مقابله با چند تصویر، ویدئو و سه بعدی در مدل های چندوجهی بزرگ

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
عنوان مقاله به فارسی LLaVA-NeXT-Interleave: مقابله با چند تصویر، ویدئو و سه بعدی در مدل های چندوجهی بزرگ
نویسندگان Feng Li, Renrui Zhang, Hao Zhang, Yuanhan Zhang, Bo Li, Wei Li, Zejun Ma, Chunyuan Li
فرمت مقاله انگلیسی PDF
تعداد صفحات 18
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computer Vision and Pattern Recognition,Computation and Language,Machine Learning,چشم انداز رایانه و تشخیص الگوی , محاسبه و زبان , یادگیری ماشین ,
توضیحات Submitted 28 July, 2024; v1 submitted 10 July, 2024; originally announced July 2024. , Comments: Project Page: https://llava-vl.github.io/blog/2024-06-16-llava-next-interleave/
توضیحات به فارسی ارسال شده 28 ژوئیه 2024 ؛V1 ارسال شده 10 ژوئیه 2024 ؛در ابتدا ژوئیه 2024 اعلام شد. ، نظرات: صفحه پروژه: https://llava-vl.github.io/blog/2024-06-16-llava-next-interleave/
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Visual instruction tuning has made considerable strides in enhancing the capabilities of Large Multimodal Models (LMMs). However, existing open LMMs largely focus on single-image tasks, their applications to multi-image scenarios remains less explored. Additionally, prior LMM research separately tackles different scenarios, leaving it impossible to generalize cross scenarios with new emerging capabilities. To this end, we introduce LLaVA-NeXT-Interleave, which simultaneously tackles Multi-image, Multi-frame (video), Multi-view (3D), and Multi-patch (single-image) scenarios in LMMs. To enable these capabilities, we regard the interleaved data format as a general template and compile the M4-Instruct dataset with 1,177.6k samples, spanning 4 primary domains with 14 tasks and 41 datasets. We also curate the LLaVA-Interleave Bench to comprehensively evaluate the multi-image performance of LMMs. Through extensive experiments, LLaVA-NeXT-Interleave achieves leading results in multi-image, video, and 3D benchmarks, while maintaining the performance of single-image tasks. Besides, our model also exhibits several emerging capabilities, e.g., transferring tasks across different settings and modalities. Code is available at https://github.com/LLaVA-VL/LLaVA-NeXT

چکیده به فارسی (ترجمه ماشینی)

تنظیم دستورالعمل بصری گام های قابل توجهی در تقویت قابلیت های مدل های بزرگ چند مدلی (LMM) انجام داده است.با این حال ، LMM های باز موجود تا حد زیادی روی کارهای تک تصویر متمرکز هستند ، برنامه های آنها در سناریوهای چند تصویر کمتر مورد کاوش قرار می گیرد.علاوه بر این ، تحقیقات قبلی LMM به طور جداگانه با سناریوهای مختلف مقابله می کند و تعمیم سناریوهای متقابل با قابلیت های جدید نوظهور غیرممکن است.برای این منظور ، ما Llava-Next-Interleave را معرفی می کنیم ، که همزمان سناریوهای چند تصویر ، چند فریم (فیلم) ، چند منظره (3D) و چند ضلعی (تک تصویر) را در LMM ها مقابله می کند.برای فعال کردن این قابلیت ها ، ما فرمت داده های درهم آمیخته را به عنوان یک الگوی کلی در نظر می گیریم و مجموعه داده های مدرک M4 را با نمونه های 1،177.6k کامپایل می کنیم و 4 حوزه اصلی را با 14 کار و 41 مجموعه داده است.ما همچنین نیمکت Llava-Interleave را برای ارزیابی جامع عملکرد چند تصویر LMM ها انجام می دهیم.از طریق آزمایش های گسترده ، Llava-Next-Interleave در معیارهای چند تصویر ، فیلم و سه بعدی به نتایج منجر می شود ، ضمن حفظ عملکرد کارهای تک تصویر.علاوه بر این ، مدل ما همچنین چندین قابلیت در حال ظهور ، به عنوان مثال ، انتقال وظایف در تنظیمات و روشهای مختلف را نشان می دهد.کد در https://github.com/llava-vl/llava-next در دسترس است

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.