ترجمه فارسی مقاله Inf-MLLM: استنتاج جریان کارآمد مدل‌های زبان بزرگ چندوجهی روی یک GPU واحد

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

عنوان مقاله به انگلیسی Inf-MLLM: Efficient Streaming Inference of Multimodal Large Language Models on a Single GPU
عنوان مقاله به فارسی Inf-MLLM: استنتاج جریان کارآمد مدل‌های زبان بزرگ چندوجهی روی یک GPU واحد
نویسندگان Zhenyu Ning, Jieru Zhao, Qihao Jin, Wenchao Ding, Minyi Guo
فرمت مقاله انگلیسی PDF
تعداد صفحات 9
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,Computer Vision and Pattern Recognition,Distributed, Parallel, and Cluster Computing,Performance,یادگیری ماشین , هوش مصنوعی , چشم انداز رایانه و تشخیص الگوی , توزیع شده , موازی و محاسبات خوشه ای , عملکرد
توضیحات Submitted 11 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده در 11 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Multimodal Large Language Models (MLLMs) are distinguished by their multimodal comprehensive ability and widely used in many real-world applications including GPT-4o, autonomous driving and robotics. Despite their impressive performance, the multimodal inputs always incur long context. The inference under long context requires caching massive Key and Value states (KV cache) of previous tokens, which introduces high latency and excessive memory consumption. Due to this reason, it is challenging to deploy streaming inference of MLLMs on edge devices, which largely constrains the power and usage of MLLMs in real-world applications. In this paper, we introduce Inf-MLLM, an efficient inference framework for MLLMs, which enable streaming inference of MLLM on a single GPU with infinite context. Inf-MLLM is based on our key observation of the attention pattern in both LLMs and MLLMs called "attention saddles". Thanks to the newly discovered attention pattern, Inf-MLLM maintains a size-constrained KV cache by dynamically caching recent tokens and relevant tokens. Furthermore, Inf-MLLM proposes attention bias, a novel approach to enable MLLMs to capture long-term dependency. We show that Inf-MLLM enables multiple LLMs and MLLMs to achieve stable performance over 4M-token long texts and multi-round conversations with 1-hour-long videos on a single GPU. In addition, Inf-MLLM exhibits superior streaming reasoning quality than existing methods such as StreamingLLM and 2x speedup than H2O.

چکیده به فارسی (ترجمه ماشینی)

مدل های بزرگ زبان چند حالته (MLLMS) با توانایی جامع چندمودال آنها متمایز می شوند و در بسیاری از برنامه های دنیای واقعی از جمله GPT-4O ، رانندگی خودمختار و روباتیک مورد استفاده قرار می گیرند.علیرغم عملکرد چشمگیر آنها ، ورودی های چند مدلی همیشه زمینه طولانی را متحمل می شوند.استنباط در زمینه طولانی نیاز به ذخیره حالات کلیدی و ارزش عظیم (حافظه نهان KV) از نشانه های قبلی دارد ، که تأخیر بالایی و مصرف بیش از حد حافظه را معرفی می کند.به همین دلیل ، استقرار استنتاج جریان MLLMS در دستگاه های لبه ، که تا حد زیادی قدرت و استفاده از MLLM ها را در برنامه های دنیای واقعی محدود می کند ، چالش برانگیز است.در این مقاله ، ما INF-MLLM ، یک چارچوب استنباط کارآمد برای MLLMS را معرفی می کنیم ، که استنباط جریان MLLM را در یک پردازنده گرافیکی واحد با زمینه نامتناهی امکان پذیر می کند.INF-MLLM مبتنی بر مشاهده کلیدی ما از الگوی توجه در هر دو LLM و MLLM به نام "زین های توجه" است.با تشکر از الگوی توجه تازه کشف شده ، INF-MLLM با ذخیره پویا نشانه های اخیر و نشانه های مربوطه ، حافظه نهان KV با اندازه را حفظ می کند.علاوه بر این ، INF-MLLM تعصب توجه را ارائه می دهد ، یک رویکرد جدید برای فعال کردن MLLMS برای جذب وابستگی طولانی مدت.ما نشان می دهیم که INF-MLLM چندین LLM و MLLM را قادر می سازد تا عملکردهای پایدار را بیش از 4 متر متون طولانی و مکالمات چند دور با فیلم های 1 ساعته در یک GPU واحد بدست آورند.علاوه بر این ، INF-MLLM کیفیت استدلال جریان برتر را نسبت به روشهای موجود مانند StreamingLLM و سرعت 2x نسبت به H2O نشان می دهد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.