ترجمه فارسی مقاله MARLIN: استنتاج موازی خودکار با دقت ترکیبی در مدل‌های زبان بزرگ

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

عنوان مقاله به انگلیسی MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models
عنوان مقاله به فارسی MARLIN: استنتاج موازی خودکار با دقت ترکیبی در مدل‌های زبان بزرگ
نویسندگان Elias Frantar, Roberto L. Castro, Jiale Chen, Torsten Hoefler, Dan Alistarh
فرمت مقاله انگلیسی PDF
تعداد صفحات 14
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,یادگیری ماشین ,
توضیحات Submitted 21 August, 2024; originally announced August 2024.
توضیحات به فارسی ارائه شده 21 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

As inference on Large Language Models (LLMs) emerges as an important workload in machine learning applications, weight quantization has become a standard technique for efficient GPU deployment. Quantization not only reduces model size, but has also been shown to yield substantial speedups for single-user inference, due to reduced memory movement, with low accuracy impact. Yet, it remains open whether speedups are achievable also in \emph{batched} settings with multiple parallel clients, which are highly relevant for practical serving. It is unclear whether GPU kernels can be designed to remain practically memory-bound, while supporting the substantially increased compute requirements of batched workloads. This paper resolves this question positively by describing the design of Mixed-precision Auto-Regressive LINear kernels, called MARLIN. Concretely, given a model whose weights are compressed via quantization to, e.g., 4 bits per element, MARLIN shows that batchsizes up to 16-32 can be supported with close to maximum ($4\times$) quantization speedup, and larger batchsizes up to 64-128 with gradually decreasing, but still significant, acceleration. MARLIN accomplishes this via a combination of techniques, such as asynchronous memory access, complex task scheduling and pipelining, and bespoke quantization support. Our experiments show that MARLIN's near-optimal performance on individual LLM layers across different scenarios can also lead to end-to-end LLM inference speedups (of up to $2.8\times$) when integrated with the popular vLLM serving engine. Finally, MARLIN is extensible to further compression techniques, like NVIDIA 2:4 sparsity, leading to additional speedups.

چکیده به فارسی (ترجمه ماشینی)

از آنجا که استنتاج در مدل های بزرگ زبان (LLMS) به عنوان یک بار کاری مهم در برنامه های یادگیری ماشین ظاهر می شود ، کمیت وزن به یک روش استاندارد برای استقرار کارآمد GPU تبدیل شده است.کمیت نه تنها اندازه مدل را کاهش می دهد ، بلکه نشان داده شده است که به دلیل کاهش حرکت حافظه ، با تأثیر دقت کم ، سرعت قابل توجهی را برای استنتاج یک کاربر به همراه دارد.با این حال ، این باز است که آیا سرعت در تنظیمات \ amp {batched} با چندین مشتری موازی قابل دستیابی است ، که برای خدمت عملی بسیار مهم هستند.مشخص نیست که آیا هسته های GPU می توانند به گونه ای طراحی شوند که عملاً به حافظه خود باقی بماند ، در حالی که از نیازهای محاسباتی قابل ملاحظه ای که بارهای کاری بسته بندی شده را افزایش می دهد ، باقی مانده است.در این مقاله با توصیف طراحی هسته های خطی خطی خودکار با عنوان Marlin ، این سؤال را برطرف می کند.به طور مشخص ، با توجه به مدلی که وزن آن از طریق کمیت فشرده می شود ، به عنوان مثال ، 4 بیت در هر عنصر ، مارلین نشان می دهد که می توان با سرعت 16-32 با حداکثر (4 $ \ $ $) سرعت بخشید ، و دسته بندی های بزرگتر تا حد64-128 با شتاب به تدریج کاهش می یابد ، اما هنوز هم قابل توجه است.مارلین این کار را از طریق ترکیبی از تکنیک ها ، مانند دسترسی به حافظه ناهمزمان ، برنامه ریزی کار پیچیده و خط لوله و پشتیبانی از کمیت از دست می دهد.آزمایشات ما نشان می دهد که عملکرد تقریباً بهینه مارلین در لایه های LLM فردی در سناریوهای مختلف همچنین می تواند منجر به سرعتهای استنتاج LLM پایان به پایان (حداکثر 2.8 \ $ $) در هنگام ادغام با موتور محبوب VLLM شود.سرانجام ، مارلین برای تکنیک های فشرده سازی بیشتر ، مانند Nvidia 2: 4 Sparsity قابل گسترش است و منجر به سرعت بیشتری می شود.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.