ترجمه فارسی مقاله STUN: هرس ساختار یافته-ساختار یافته وقت برای هرس MOE مقیاس پذیر

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی STUN: Structured-Then-Unstructured Pruning for Scalable MoE Pruning
عنوان مقاله به فارسی STUN: هرس ساختار یافته-ساختار یافته وقت برای هرس MOE مقیاس پذیر
نویسندگان Jaeseong Lee, seung-won hwang, Aurick Qiao, Daniel F Campos, Zhewei Yao, Yuxiong He
فرمت مقاله انگلیسی PDF
تعداد صفحات 17
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Computation and Language,یادگیری ماشین , محاسبه و زبان ,
توضیحات Submitted 10 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده 10 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Mixture-of-experts (MoEs) have been adopted for reducing inference costs by sparsely activating experts in Large language models (LLMs). Despite this reduction, the massive number of experts in MoEs still makes them expensive to serve. In this paper, we study how to address this, by pruning MoEs. Among pruning methodologies, unstructured pruning has been known to achieve the highest performance for a given pruning ratio, compared to structured pruning, since the latter imposes constraints on the sparsification structure. This is intuitive, as the solution space of unstructured pruning subsumes that of structured pruning. However, our counterintuitive finding reveals that expert pruning, a form of structured pruning, can actually precede unstructured pruning to outperform unstructured-only pruning. As existing expert pruning, requiring $O(\frac{k^n}{\sqrt{n}})$ forward passes for $n$ experts, cannot scale for recent MoEs, we propose a scalable alternative with $O(1)$ complexity, yet outperforming the more expensive methods. The key idea is leveraging a latent structure between experts, based on behavior similarity, such that the greedy decision of whether to prune closely captures the joint pruning effect. Ours is highly effective -- for Snowflake Arctic, a 480B-sized MoE with 128 experts, our method needs only one H100 and two hours to achieve nearly no loss in performance with 40% sparsity, even in generative tasks such as GSM8K, where state-of-the-art unstructured pruning fails to. The code will be made publicly available.

چکیده به فارسی (ترجمه ماشینی)

مخلوط کنفرانس (MOE) برای کاهش هزینه های استنباط توسط فعال کردن کارشناسان در مدلهای بزرگ زبان (LLM) اتخاذ شده است.با وجود این کاهش ، تعداد گسترده ای از متخصصان MOE هنوز آنها را برای خدمت به آنها گران می کند.در این مقاله ، ما با هرس MOES نحوه رسیدگی به این موضوع را مطالعه می کنیم.در میان روشهای هرس ، هرس بدون ساختار برای دستیابی به بالاترین عملکرد برای یک نسبت هرس معین ، در مقایسه با هرس ساختاری شناخته شده است ، زیرا دومی محدودیت هایی را در ساختار پراکندگی تحمیل می کند.این بصری است ، زیرا فضای راه حل هرس بدون ساختار که از هرس ساختار یافته است.با این حال ، یافته ضد انعطاف پذیر ما نشان می دهد که هرس متخصص ، نوعی هرس ساختار یافته ، در واقع می تواند قبل از هرس بدون ساختار برای بهتر از هرس فقط بدون ساختار باشد.به عنوان هرس متخصص موجود ، نیاز به $ O (\ frac {k^n} {\ sqrt {n})) $ به جلو برای کارشناسان $ n $ عبور می کند ، نمی تواند برای MOE های اخیر مقیاس کند ، ما یک جایگزین مقیاس پذیر با $ O (1) پیشنهاد می کنیم.پیچیدگی $ ، اما در عین حال از روشهای گران قیمت بهتر است.ایده اصلی استفاده از یک ساختار نهفته بین کارشناسان ، بر اساس شباهت رفتار است ، به گونه ای که تصمیم حریص در مورد اینکه آیا هرس از نزدیک اثر هرس مشترک را ضبط می کند.ما بسیار مؤثر است-برای Snowflake Arctic ، یک MOE به اندازه 480b با 128 متخصص ، روش ما فقط به یک H100 و دو ساعت نیاز دارد تا تقریباً با 40 ٪ کمبود عملکرد ، حتی در کارهای تولیدی مانند GSM8K ، که در آن حالت است ، از دست ندهد-از هرس بدون ساختار بدون ساختار.این کد به صورت عمومی در دسترس خواهد بود.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.