ترجمه فارسی مقاله آموزش پراکندگی مختلط: دستیابی به کاهش FLOP 4$ برابر دلار برای پیش‌آموزش ترانسفورماتور

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

عنوان مقاله به انگلیسی Mixed Sparsity Training: Achieving 4$\times$ FLOP Reduction for Transformer Pretraining
عنوان مقاله به فارسی آموزش پراکندگی مختلط: دستیابی به کاهش FLOP 4$\ برابر دلار برای پیش‌آموزش ترانسفورماتور
نویسندگان Pihe Hu, Shaolong Li, Longbo Huang
فرمت مقاله انگلیسی PDF
تعداد صفحات 21
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,یادگیری ماشین ,
توضیحات Submitted 21 August, 2024; originally announced August 2024.
توضیحات به فارسی ارائه شده 21 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Large language models (LLMs) have made significant strides in complex tasks, yet their widespread adoption is impeded by substantial computational demands. With hundreds of billion parameters, transformer-based LLMs necessitate months of pretraining across a high-end GPU cluster. However, this paper reveals a compelling finding: transformers exhibit considerable redundancy in pretraining computations, which motivates our proposed solution, Mixed Sparsity Training (MST), an efficient pretraining method that can reduce about $75\%$ of Floating Point Operations (FLOPs) while maintaining performance. MST integrates dynamic sparse training (DST) with Sparsity Variation (SV) and Hybrid Sparse Attention (HSA) during pretraining, involving three distinct phases: warm-up, ultra-sparsification, and restoration. The warm-up phase transforms the dense model into a sparse one, and the restoration phase reinstates connections. Throughout these phases, the model is trained with a dynamically evolving sparse topology and an HSA mechanism to maintain performance and minimize training FLOPs concurrently. Our experiment on GPT-2 showcases a FLOP reduction of $4\times$ without compromising performance.

چکیده به فارسی (ترجمه ماشینی)

مدل های بزرگ زبان (LLM) در کارهای پیچیده گام های قابل توجهی برداشته اند ، اما پذیرش گسترده آنها توسط خواسته های محاسباتی قابل توجهی مانع می شود.با صدها میلیارد پارامتر ، LLM های مبتنی بر ترانسفورماتور نیاز به ماههای پیش از پیش در یک خوشه GPU با سطح بالا دارند.با این حال ، این مقاله یک یافته قانع کننده را نشان می دهد: ترانسفورماتورها افزونگی قابل توجهی در محاسبات پیش ساز نشان می دهند ، که انگیزه راه حل پیشنهادی ما ، آموزش پراکندگی مختلط (MST) ، یک روش مقدماتی کارآمد که می تواند حدود 75 \ $ از عملیات نقطه شناور (FLOPS) را کاهش دهدحفظ عملکردMST آموزش پراکنده پویا (DST) را با تنوع پراکنده (SV) و توجه پراکنده ترکیبی (HSA) در طول مقدمات ادغام می کند ، شامل سه مرحله مجزا: گرم کردن ، فوق العاده شفاف سازی و ترمیم.فاز گرم کردن مدل متراکم را به یک پراکنده تبدیل می کند و مرحله ترمیم اتصالات را بازگرداند.در طول این مراحل ، این مدل با یک توپولوژی پراکنده در حال تحول پویا و یک مکانیسم HSA برای حفظ عملکرد و به حداقل رساندن فلاپ های آموزش همزمان آموزش داده می شود.آزمایش ما در GPT-2 نشان می دهد که کاهش فلاپ 4 \ برابر $ $ بدون به خطر انداختن عملکرد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.