ترجمه فارسی مقاله بازبینی مدل‌های زبان SMoE با ارزیابی ناکارآمدی‌ها با هرس تخصصی کار خاص

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Revisiting SMoE Language Models by Evaluating Inefficiencies with Task Specific Expert Pruning
عنوان مقاله به فارسی بازبینی مدل‌های زبان SMoE با ارزیابی ناکارآمدی‌ها با هرس تخصصی کار خاص
نویسندگان Soumajyoti Sarkar, Leonard Lausen, Volkan Cevher, Sheng Zha, Thomas Brox, George Karypis
فرمت مقاله انگلیسی PDF
تعداد صفحات 18
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Computation and Language,یادگیری ماشین , محاسبه و زبان ,
توضیحات Submitted 2 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده در 2 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Sparse Mixture of Expert (SMoE) models have emerged as a scalable alternative to dense models in language modeling. These models use conditionally activated feedforward subnetworks in transformer blocks, allowing for a separation between total model parameters and per-example computation. However, large token-routed SMoE models face a significant challenge: during inference, the entire model must be used for a sequence or a batch, resulting in high latencies in a distributed setting that offsets the advantages of per-token sparse activation. Our research explores task-specific model pruning to inform decisions about designing SMoE architectures, mainly modulating the choice of expert counts in pretraining. We investigate whether such pruned models offer advantages over smaller SMoE models trained from scratch, when evaluating and comparing them individually on tasks. To that end, we introduce an adaptive task-aware pruning technique UNCURL to reduce the number of experts per MoE layer in an offline manner post-training. Our findings reveal a threshold pruning factor for the reduction that depends on the number of experts used in pretraining, above which, the reduction starts to degrade model performance. These insights contribute to our understanding of model design choices when pretraining with SMoE architectures, particularly useful when considering task-specific inference optimization for later stages.

چکیده به فارسی (ترجمه ماشینی)

مخلوط پراکنده از مدلهای متخصص (SMOE) به عنوان یک جایگزین مقیاس پذیر برای مدل های متراکم در مدل سازی زبان ظاهر شده است.این مدلها از زیر شبکه های فید فرفورژه فعال شده در بلوک های ترانسفورماتور استفاده می کنند و امکان جداسازی بین پارامترهای مدل کل و محاسبه هر نمونه را فراهم می کنند.با این حال ، مدل های بزرگ SMOE با توکن بزرگ با یک چالش مهم روبرو هستند: در طول استنتاج ، از کل مدل باید برای یک دنباله یا یک دسته استفاده شود ، در نتیجه تأخیرهای بالا در یک مجموعه توزیع شده که مزایای فعال سازی پراکنده در هر بار را جبران می کند.تحقیقات ما به بررسی هرس مدل خاص وظیفه برای اطلاع رسانی در مورد تصمیمات در مورد طراحی معماری SMOE ، عمدتاً تعدیل انتخاب شمارش متخصص در پیشگویی.ما بررسی می کنیم که آیا چنین مدل های هرس شده در هنگام ارزیابی و مقایسه آنها به صورت جداگانه در کارها ، مزایایی نسبت به مدل های SMOE کوچکتر آموزش داده شده از ابتدا ارائه می دهند.برای این منظور ، ما یک تکنیک هرس آگاهی از آگاهی از وظیفه تطبیقی ​​را معرفی می کنیم تا تعداد متخصصان در هر لایه MOE را به روش آفلاین پس از آموزش کاهش دهیم.یافته های ما یک عامل هرس آستانه را برای کاهش نشان می دهد که به تعداد متخصصان مورد استفاده در پیش از این بستگی دارد ، در بالای آنها ، کاهش عملکرد مدل را شروع می کند.این بینش ها در درک ما از انتخاب مدل طراحی در هنگام پیشبرد با معماری SMOE ، به ویژه هنگام در نظر گرفتن بهینه سازی استنتاج خاص کار برای مراحل بعدی ، کمک می کند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.