ترجمه فارسی مقاله CHESS: بهینه‌سازی استنتاج LLM از طریق آستانه‌گذاری کانالی و پراکندگی انتخابی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی CHESS: Optimizing LLM Inference via Channel-Wise Thresholding and Selective Sparsification
عنوان مقاله به فارسی CHESS: بهینه‌سازی استنتاج LLM از طریق آستانه‌گذاری کانالی و پراکندگی انتخابی
نویسندگان Junhui He, Shangyu Wu, Weidong Wen, Chun Jason Xue, Qingan Li
فرمت مقاله انگلیسی PDF
تعداد صفحات 12
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computation and Language,Artificial Intelligence,Machine Learning,محاسبه و زبان , هوش مصنوعی , یادگیری ماشین ,
توضیحات Submitted 2 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده در 2 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Deploying large language models (LLMs) on edge devices presents significant challenges due to the substantial computational overhead and memory requirements. Activation sparsification can mitigate these challenges by reducing the number of activated neurons during inference. Existing methods typically employ thresholding-based sparsification based on the statistics of activation tensors. However, these methods do not explicitly model the impact of activation sparsification on performance, leading to suboptimal performance degradation. To address this issue, this paper reformulates the activation sparsification problem by introducing a new objective that optimizes the sparsification decisions. Building on this reformulation, we propose CHESS, a general activation sparsification approach via CHannel-wise thrEsholding and Selective Sparsification. First, channel-wise thresholding assigns a unique threshold to each activation channel in the feed-forward network (FFN) layers. Then, selective sparsification involves applying thresholding-based activation sparsification to specific layers within the attention modules. Finally, we detail the implementation of sparse kernels to accelerate LLM inference. Experimental results demonstrate that the proposed CHESS achieves lower performance degradation over 8 downstream tasks while activating fewer parameters compared to existing methods, thus speeding up the LLM inference by up to 1.27x.

چکیده به فارسی (ترجمه ماشینی)

استفاده از مدل های بزرگ زبان (LLMS) در دستگاه های Edge به دلیل استفاده از سربار محاسباتی قابل توجه و نیازهای حافظه ، چالش های قابل توجهی را نشان می دهد.پراکندگی فعال سازی می تواند با کاهش تعداد نورون های فعال شده در هنگام استنتاج ، این چالش ها را کاهش دهد.روشهای موجود به طور معمول بر اساس آمار تانسرهای فعال سازی ، از کمبودهای مبتنی بر آستانه استفاده می کنند.با این حال ، این روش ها به صراحت تأثیر پراکندگی فعال سازی بر عملکرد را مدل نمی کنند و منجر به تخریب عملکرد زیر حد می شوند.برای پرداختن به این موضوع ، این مقاله با معرفی یک هدف جدید که تصمیمات پراکندگی را بهینه می کند ، مشکل پراکندگی فعال سازی را اصلاح می کند.با تکیه بر این اصلاحات ، ما شطرنج را پیشنهاد می کنیم ، یک رویکرد پراکندگی فعال سازی کلی از طریق آستانه کانال عاقلانه و انتخاب انتخابی.اول ، آستانه کانال عاقلانه آستانه ای منحصر به فرد را به هر کانال فعال سازی در لایه های شبکه تغذیه (FFN) اختصاص می دهد.سپس ، پراکندگی انتخابی شامل استفاده از پراکندگی فعال سازی مبتنی بر آستانه بر روی لایه های خاص در ماژول های توجه است.سرانجام ، ما جزئیات اجرای هسته های پراکنده را برای تسریع در استنتاج LLM شرح می دهیم.نتایج تجربی نشان می دهد که شطرنج پیشنهادی در حالی که پارامترهای کمتری را در مقایسه با روشهای موجود فعال می کند ، به تخریب عملکرد پایین تر از 8 کار پایین دست دست می یابد ، بنابراین استنتاج LLM را تا 1.27x سرعت می بخشد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.