ترجمه فارسی مقاله Duplex: دستگاهی برای مدل‌های زبان بزرگ با ترکیبی از متخصصان، توجه به پرس و جو گروهی و دسته‌بندی مداوم

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Duplex: A Device for Large Language Models with Mixture of Experts, Grouped Query Attention, and Continuous Batching
عنوان مقاله به فارسی Duplex: دستگاهی برای مدل‌های زبان بزرگ با ترکیبی از متخصصان، توجه به پرس و جو گروهی و دسته‌بندی مداوم
نویسندگان Sungmin Yun, Kwanhee Kyung, Juhwan Cho, Jaewan Choi, Jongmin Kim, Byeongho Kim, Sukhan Lee, Kyomin Sohn, Jung Ho Ahn
فرمت مقاله انگلیسی PDF
تعداد صفحات 15
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Hardware Architecture,Machine Learning,معماری سخت افزار , یادگیری ماشین ,
توضیحات Submitted 2 September, 2024; originally announced September 2024. , Comments: 15 pages, 16 figures, accepted at MICRO 2024
توضیحات به فارسی ارسال شده در 2 سپتامبر 2024 ؛در ابتدا در سپتامبر 2024 اعلام شد ، نظرات: 15 صفحه ، 16 شکل ، در میکرو 2024 پذیرفته شده است
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Large language models (LLMs) have emerged due to their capability to generate high-quality content across diverse contexts. To reduce their explosively increasing demands for computing resources, a mixture of experts (MoE) has emerged. The MoE layer enables exploiting a huge number of parameters with less computation. Applying state-of-the-art continuous batching increases throughput; however, it leads to frequent DRAM access in the MoE and attention layers. We observe that conventional computing devices have limitations when processing the MoE and attention layers, which dominate the total execution time and exhibit low arithmetic intensity (Op/B). Processing MoE layers only with devices targeting low-Op/B such as processing-in-memory (PIM) architectures is challenging due to the fluctuating Op/B in the MoE layer caused by continuous batching. To address these challenges, we propose Duplex, which comprises xPU tailored for high-Op/B and Logic-PIM to effectively perform low-Op/B operation within a single device. Duplex selects the most suitable processor based on the Op/B of each layer within LLMs. As the Op/B of the MoE layer is at least 1 and that of the attention layer has a value of 4-8 for grouped query attention, prior PIM architectures are not efficient, which place processing units inside DRAM dies and only target extremely low-Op/B (under one) operations. Based on recent trends, Logic-PIM adds more through-silicon vias (TSVs) to enable high-bandwidth communication between the DRAM die and the logic die and place powerful processing units on the logic die, which is best suited for handling low-Op/B operations ranging from few to a few dozens. To maximally utilize the xPU and Logic-PIM, we propose expert and attention co-processing.

چکیده به فارسی (ترجمه ماشینی)

مدلهای بزرگ زبان (LLM) به دلیل توانایی آنها در تولید محتوای با کیفیت بالا در زمینه های متنوع پدید آمده اند.برای کاهش تقاضای فزاینده انفجاری آنها برای منابع محاسباتی ، ترکیبی از متخصصان (MOE) پدیدار شده است.لایه MOE از تعداد زیادی پارامترها با محاسبه کمتر استفاده می کند.استفاده از دسته های مداوم از هنر ، توان را افزایش می دهد.با این حال ، منجر به دسترسی مکرر درام در لایه های MOE و توجه می شود.ما مشاهده می کنیم که دستگاه های محاسباتی معمولی هنگام پردازش لایه های MOE و توجه محدودیت هایی دارند ، که بر زمان اجرای کل حاکم است و شدت حسابی کم (OP/B) را نشان می دهند.پردازش لایه های MOE فقط با دستگاه هایی که با هدف کمبود OP/B مانند معماری پردازش در حافظه (PIM) هدف قرار می گیرند به دلیل نوسان OP/B در لایه MOE ناشی از دسته بندی مداوم ، چالش برانگیز است.برای پرداختن به این چالش ها ، ما Duplex را پیشنهاد می کنیم ، که شامل XPU متناسب با OP/B و Logic-PIM است تا به طور مؤثر عملکرد کم OP/B را در یک دستگاه واحد انجام دهد.Duplex مناسب ترین پردازنده را بر اساس OP/B هر لایه در LLMS انتخاب می کند.از آنجا که OP/B از لایه MOE حداقل 1 است و لایه توجه برای توجه پرس و جو گروهی دارای مقدار 4-8 است ، معماری های PIM قبلی کارآمد نیستند ، که واحدهای پردازش را در داخل DRAM می کشند و فقط بسیار کم هدف قرار می دهند-OP/B (زیر یک) عملیات.براساس روندهای اخیر ، منطق-PIM بیشتر VIAS-Silicon (TSV) را اضافه می کند تا ارتباطات پهنای باند بین DRAM را بمیرد و منطق می میرد و واحدهای پردازش قدرتمند را بر روی خطای منطق قرار می دهد ، که برای دستیابی به سطح پایین مناسب است./B عملیات از چند تا چند ده.برای استفاده حداکثر از XPU و Logic-PIM ، ما پردازش متخصص و توجه را پیشنهاد می کنیم.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.