ترجمه فارسی مقاله OPAL: Outlier-Preserved Microscaling Quantization یک شتاب دهنده برای مدل های زبان بزرگ تولیدی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی OPAL: Outlier-Preserved Microscaling Quantization A ccelerator for Generative Large Language Models
عنوان مقاله به فارسی OPAL: Outlier-Preserved Microscaling Quantization یک شتاب دهنده برای مدل های زبان بزرگ تولیدی
نویسندگان Jahyun Koo, Dahoon Park, Sangwoo Jung, Jaeha Kung
فرمت مقاله انگلیسی PDF
تعداد صفحات 8
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Hardware Architecture,Computation and Language,یادگیری ماشین , معماری سخت افزار , محاسبات و زبان ,
توضیحات Submitted 5 September, 2024; originally announced September 2024. , Comments: 7 pages, 8 figures, DAC2024 accepted
توضیحات به فارسی ارسال شده در 5 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد ، نظرات: 7 صفحه ، 8 شکل ، DAC2024 پذیرفته شده
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

To overcome the burden on the memory size and bandwidth due to ever-increasing size of large language models (LLMs), aggressive weight quantization has been recently studied, while lacking research on quantizing activations. In this paper, we present a hardware-software co-design method that results in an energy-efficient LLM accelerator, named OPAL, for generation tasks. First of all, a novel activation quantization method that leverages the microscaling data format while preserving several outliers per sub-tensor block (e.g., four out of 128 elements) is proposed. Second, on top of preserving outliers, mixed precision is utilized that sets 5-bit for inputs to sensitive layers in the decoder block of an LLM, while keeping inputs to less sensitive layers to 3-bit. Finally, we present the OPAL hardware architecture that consists of FP units for handling outliers and vectorized INT multipliers for dominant non-outlier related operations. In addition, OPAL uses log2-based approximation on softmax operations that only requires shift and subtraction to maximize power efficiency. As a result, we are able to improve the energy efficiency by 1.6~2.2x, and reduce the area by 2.4~3.1x with negligible accuracy loss, i.e., <1 perplexity increase.

چکیده به فارسی (ترجمه ماشینی)

برای غلبه بر بار در اندازه حافظه و پهنای باند به دلیل اندازه روزافزون مدلهای بزرگ زبان (LLM) ، اخیراً کمیت وزن تهاجمی مورد مطالعه قرار گرفته است ، در حالی که فاقد تحقیقات در زمینه کمیت فعال سازی است.در این مقاله ، ما یک روش طراحی مشترک سخت افزار را ارائه می دهیم که منجر به یک شتاب دهنده LLM با انرژی کارآمد ، به نام Opal ، برای کارهای نسل می شود.اول از همه ، یک روش کمیت فعال سازی جدید که در ضمن حفظ چندین دور از هر بلوک زیر تنیسور (به عنوان مثال ، چهار از 128 عنصر) از قالب داده های میکروسکوپی استفاده می کند.دوم ، در بالای حفظ قسمت های دور ، از دقت مختلط استفاده می شود که 5 بیتی را برای ورودی به لایه های حساس در بلوک رمزگذار یک LLM تعیین می کند ، در حالی که ورودی ها را به لایه های حساس تر به 3 بیت نگه می دارد.سرانجام ، ما معماری سخت افزار اوپال را ارائه می دهیم که از واحدهای FP برای استفاده از خارج از کشور و ضربهای int بردار شده برای عملیات غالب غیرقانونی غالب تشکیل شده است.علاوه بر این ، OPAL از تقریب مبتنی بر log2 در عملیات SoftMax استفاده می کند که فقط برای حداکثر رساندن راندمان انرژی به تغییر و تفریق نیاز دارد.در نتیجه ، ما می توانیم راندمان انرژی را با 2.2 ~ 2.2 برابر بهبود دهیم و منطقه را با از دست دادن دقت ناچیز ، 3.1 برابر با 2.4 ~ 2.4 کاهش دهیم ، یعنی افزایش دفع.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.