ترجمه فارسی مقاله استراتژی متعادل کردن بار بدون تلفات کمکی برای ترکیبی از متخصصان

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts
عنوان مقاله به فارسی استراتژی متعادل کردن بار بدون تلفات کمکی برای ترکیبی از متخصصان
نویسندگان Lean Wang, Huazuo Gao, Chenggang Zhao, Xu Sun, Damai Dai
فرمت مقاله انگلیسی PDF
تعداد صفحات 14
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Computation and Language,یادگیری ماشین , محاسبه و زبان ,
توضیحات Submitted 28 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده 28 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

For Mixture-of-Experts (MoE) models, an unbalanced expert load will lead to routing collapse or increased computational overhead. Existing methods commonly employ an auxiliary loss to encourage load balance, but a large auxiliary loss will introduce non-negligible interference gradients into training and thus impair the model performance. In order to control load balance while not producing undesired gradients during training, we propose Loss-Free Balancing, featured by an auxiliary-loss-free load balancing strategy. To be specific, before the top-K routing decision, Loss-Free Balancing will first apply an expert-wise bias to the routing scores of each expert. By dynamically updating the bias of each expert according to its recent load, Loss-Free Balancing can consistently maintain a balanced distribution of expert load. In addition, since Loss-Free Balancing does not produce any interference gradients, it also elevates the upper bound of model performance gained from MoE training. We validate the performance of Loss-Free Balancing on MoE models with up to 3B parameters trained on up to 200B tokens. Experimental results show that Loss-Free Balancing achieves both better performance and better load balance compared with traditional auxiliary-loss-controlled load balancing strategies.

چکیده به فارسی (ترجمه ماشینی)

برای مدل های مخلوط (MOE) ، یک بار متخصص نامتعادل منجر به سقوط مسیریابی یا افزایش سربار محاسباتی می شود.روشهای موجود معمولاً از ضرر کمکی برای تشویق تعادل بار استفاده می کنند ، اما ضرر کمکی بزرگ شیب تداخل غیر قابل تبعیض را به آموزش معرفی می کند و در نتیجه عملکرد مدل را مختل می کند.به منظور کنترل تعادل بار در حالی که در حین آموزش شیب های ناخواسته تولید نمی کند ، ما تعادل بدون از دست دادن را پیشنهاد می کنیم ، که توسط یک استراتژی متعادل کننده بار بدون از دست دادن کمکی نشان داده شده است.به طور خاص ، قبل از تصمیم مسیریابی Top-K ، تعادل بدون ضرر ابتدا یک تعصب متخصص را برای نمرات مسیریابی هر متخصص اعمال می کند.با به روزرسانی پویا تعصب هر متخصص با توجه به بار اخیر خود ، تعادل بدون از دست دادن می تواند به طور مداوم توزیع متعادل بار متخصص را حفظ کند.علاوه بر این ، از آنجا که تعادل بدون از دست دادن هیچ شیب تداخل ایجاد نمی کند ، همچنین حد بالایی از عملکرد مدل به دست آمده از آموزش MOE را بالا می برد.ما عملکرد تعادل بدون از دست دادن را در مدل های MOE با پارامترهای 3B آموزش داده شده در توکن های حداکثر 200B تأیید می کنیم.نتایج تجربی نشان می دهد که تعادل بدون از دست دادن هم عملکرد بهتر و هم در تعادل بار بهتر در مقایسه با استراتژی های سنتی با استفاده از ضرر با ضعف بار ، به دست می آید.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.