کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs
چکیده
We have observed a distinctive quantization-related behavior in the LLaMA3/3.1-70B models that is absent in both the LLaMA2-70B and LLaMA3/3.1-8B/405B models. Quantization is a crucial technique for deploying large language models (LLMs) efficiently. Among various bit widths and representations for weights and activations, the 8-bit integer weight and 8-bit integer activation (W8A8) configuration is particularly popular due to its widespread hardware support. However, the impact of W8A8 post-training quantization on model accuracy remains contentious. While several studies have suggested calibrating either weights or activations to mitigate accuracy degradation, a comprehensive solution has yet to be identified. In this paper, we empirically investigate multiple LLMs featured on an open LLM leaderboard, discovering that the LLaMA3-70B model series have a unique accuracy degradation behavior with W8A8 per-channel post-training quantization. In contrast, other model series such as LLaMA2, LLaMA3-8B, Qwen, Mixtral, Mistral, Phi-3, and Falcon demonstrate robust performance with W8A8, sometimes surpassing their FP16 counterparts. Contrary to previous assertions attributing degradation to the large dynamic range of activations, our findings indicate that the weight distribution of the LLaMA3-70B is the primary factor behind the vulnerability. By meticulously analyzing the distinct characteristics of weight distributions across Transformer blocks, we propose a mixed strategy with less than 3% of the layers enabling finer W8A8 quantization granularity, while the remaining 97% of layers retain the per-channel configuration. As a result, the average accuracy of LLaMA3-70B-W8A8 is increased from 45.5% to 73.4% (just 0.7% shy of LLaMA3-70B-FP16) across eight reasoning tasks. Notably, our method requires neither calibration nor fine-tuning.
چکیده به فارسی (ترجمه ماشینی)
ما یک رفتار مرتبط با کمیت متمایز در مدل های LLAMA3/3.1-70B مشاهده کرده ایم که در هر دو مدل LLAMA2-70B و LLAMA3/3.1-8B/405B وجود ندارد.کمیت یک روش مهم برای استفاده از مدلهای بزرگ زبان (LLM) به طور مؤثر است.در میان عرض های بیت و بازنمایی های مختلف برای وزنه ها و فعال سازی ها ، وزن عدد صحیح 8 بیتی و پیکربندی عدد صحیح 8 بیتی (W8A8) به دلیل پشتیبانی سخت افزاری گسترده آن ، به ویژه محبوب است.با این حال ، تأثیر کمیت پس از آموزش W8A8 بر دقت مدل بحث برانگیز است.در حالی که مطالعات متعددی کالیبراسیون وزن یا فعال سازی را برای کاهش تخریب دقت نشان داده اند ، هنوز یک راه حل جامع مشخص نشده است.در این مقاله ، ما به صورت تجربی بررسی می کنیم که چندین LLM در یک تابلوی LLM باز نشان داده شده است ، و کشف می کنیم که سری مدل LLAMA3-70B دارای یک رفتار تخریب دقت منحصر به فرد با W8A8 در هر کانال کمی است.در مقابل ، سریال های دیگر مدل مانند LLAMA2 ، LLAMA3-8B ، QWEN ، MIXTRAL ، MISTRAL ، PHI-3 و FALCON عملکرد قوی را با W8A8 نشان می دهند ، و گاهی اوقات از همتایان FP16 خود پیشی می گیرند.برخلاف ادعاهای قبلی که باعث تخریب به دامنه پویا بزرگ فعال سازی ها می شود ، یافته های ما نشان می دهد که توزیع وزن LLAMA3-70B عامل اصلی آسیب پذیری است.با تجزیه و تحلیل دقیق ویژگی های متمایز توزیع وزن در بلوک های ترانسفورماتور ، ما یک استراتژی مختلط را با کمتر از 3 ٪ از لایه ها ارائه می دهیم که باعث می شود دانه بندی کمی W8A8 ظریف تر باشد ، در حالی که 97 ٪ باقی مانده از لایه ها پیکربندی هر کانال را حفظ می کنند.در نتیجه ، میانگین دقت LLAMA3-70B-W8A8 از 45.5 ٪ به 73.4 ٪ (فقط 0.7 ٪ خجالتی از LLAMA3-70B-FP16) در هشت کار استدلال افزایش می یابد.نکته قابل توجه ، روش ما نه به کالیبراسیون و نه تنظیم دقیق نیاز دارد.
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs