کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs
چکیده
As inference on Large Language Models (LLMs) emerges as an important workload in machine learning applications, weight quantization has become a standard technique for efficient GPU deployment. Quantization not only reduces model size, but has also been shown to yield substantial speedups for single-user inference, due to reduced memory movement, with low accuracy impact. Yet, it remains open whether speedups are achievable also in \emph{batched} settings with multiple parallel clients, which are highly relevant for practical serving. It is unclear whether GPU kernels can be designed to remain practically memory-bound, while supporting the substantially increased compute requirements of batched workloads. This paper resolves this question positively by describing the design of Mixed-precision Auto-Regressive LINear kernels, called MARLIN. Concretely, given a model whose weights are compressed via quantization to, e.g., 4 bits per element, MARLIN shows that batchsizes up to 16-32 can be supported with close to maximum ($4\times$) quantization speedup, and larger batchsizes up to 64-128 with gradually decreasing, but still significant, acceleration. MARLIN accomplishes this via a combination of techniques, such as asynchronous memory access, complex task scheduling and pipelining, and bespoke quantization support. Our experiments show that MARLIN's near-optimal performance on individual LLM layers across different scenarios can also lead to end-to-end LLM inference speedups (of up to $2.8\times$) when integrated with the popular vLLM serving engine. Finally, MARLIN is extensible to further compression techniques, like NVIDIA 2:4 sparsity, leading to additional speedups.
چکیده به فارسی (ترجمه ماشینی)
از آنجا که استنتاج در مدل های بزرگ زبان (LLMS) به عنوان یک بار کاری مهم در برنامه های یادگیری ماشین ظاهر می شود ، کمیت وزن به یک روش استاندارد برای استقرار کارآمد GPU تبدیل شده است.کمیت نه تنها اندازه مدل را کاهش می دهد ، بلکه نشان داده شده است که به دلیل کاهش حرکت حافظه ، با تأثیر دقت کم ، سرعت قابل توجهی را برای استنتاج یک کاربر به همراه دارد.با این حال ، این باز است که آیا سرعت در تنظیمات \ amp {batched} با چندین مشتری موازی قابل دستیابی است ، که برای خدمت عملی بسیار مهم هستند.مشخص نیست که آیا هسته های GPU می توانند به گونه ای طراحی شوند که عملاً به حافظه خود باقی بماند ، در حالی که از نیازهای محاسباتی قابل ملاحظه ای که بارهای کاری بسته بندی شده را افزایش می دهد ، باقی مانده است.در این مقاله با توصیف طراحی هسته های خطی خطی خودکار با عنوان Marlin ، این سؤال را برطرف می کند.به طور مشخص ، با توجه به مدلی که وزن آن از طریق کمیت فشرده می شود ، به عنوان مثال ، 4 بیت در هر عنصر ، مارلین نشان می دهد که می توان با سرعت 16-32 با حداکثر (4 $ \ $ $) سرعت بخشید ، و دسته بندی های بزرگتر تا حد64-128 با شتاب به تدریج کاهش می یابد ، اما هنوز هم قابل توجه است.مارلین این کار را از طریق ترکیبی از تکنیک ها ، مانند دسترسی به حافظه ناهمزمان ، برنامه ریزی کار پیچیده و خط لوله و پشتیبانی از کمیت از دست می دهد.آزمایشات ما نشان می دهد که عملکرد تقریباً بهینه مارلین در لایه های LLM فردی در سناریوهای مختلف همچنین می تواند منجر به سرعتهای استنتاج LLM پایان به پایان (حداکثر 2.8 \ $ $) در هنگام ادغام با موتور محبوب VLLM شود.سرانجام ، مارلین برای تکنیک های فشرده سازی بیشتر ، مانند Nvidia 2: 4 Sparsity قابل گسترش است و منجر به سرعت بیشتری می شود.
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs