ترجمه فارسی مقاله بهره‌برداری از موازی‌سازی دانشجویی برای استنتاج GPU با تأخیر پایین مدل‌های شبیه BERT در خدمات آنلاین

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Exploiting Student Parallelism for Low-latency GPU Inference of BERT-like Models in Online Services
عنوان مقاله به فارسی بهره‌برداری از موازی‌سازی دانشجویی برای استنتاج GPU با تأخیر پایین مدل‌های شبیه BERT در خدمات آنلاین
نویسندگان Weiyan Wang, Yilun Jin, Yiming Zhang, Victor Junqiu Wei, Han Tian, Li Chen, Kai Chen
فرمت مقاله انگلیسی PDF
تعداد صفحات 11
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,یادگیری ماشین ,
توضیحات Submitted 22 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده در 22 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Due to high accuracy, BERT-like models have been widely adopted by discriminative text mining and web searching. However, large BERT-like models suffer from inefficient online inference, as they face the following two problems on GPUs. First, they rely on the large model depth to achieve high accuracy, which linearly increases the sequential computation on GPUs. Second, stochastic and dynamic online workloads cause extra costs. In this paper, we present Academus for low-latency online inference of BERT-like models. At the core of Academus is the novel student parallelism, which adopts boosting ensemble and stacking distillation to distill the original deep model into an equivalent group of parallel and shallow student models. This enables Academus to achieve the lower model depth (e.g., two layers) than baselines and consequently the lowest inference latency without affecting the accuracy.For occasional workload bursts, it can temporarily decrease the number of students with minimal accuracy loss to improve throughput. Additionally, it employs specialized system designs for student parallelism to better handle stochastic online workloads. We conduct comprehensive experiments to verify the effectiveness. The results show that Academus outperforms the baselines by 4.1X~1.6X in latency without compromising accuracy, and achieves up to 22.27X higher throughput for workload bursts.

چکیده به فارسی (ترجمه ماشینی)

با توجه به دقت بالا ، مدل های شبیه به Bert به طور گسترده ای توسط استخراج متن تبعیض آمیز و جستجوی وب اتخاذ شده اند.با این حال ، مدل های بزرگ مانند Bert از استنباط آنلاین ناکارآمد رنج می برند ، زیرا در GPU ها با دو مشکل زیر روبرو هستند.اول ، آنها برای دستیابی به دقت بالا به عمق مدل بزرگ متکی هستند ، که به طور خطی محاسبه متوالی روی GPU ها را افزایش می دهد.دوم ، بارهای آنلاین تصادفی و پویا باعث هزینه های اضافی می شود.در این مقاله ، ما آکادمی را برای استنباط آنلاین با تأخیر در مدل های شبیه به Bert ارائه می دهیم.در هسته آکادمیوس ، موازی سازی دانشجویی جدید است که باعث تقویت گروه و تقطیر انباشته شده برای تقطیر مدل عمیق اصلی در یک گروه معادل مدلهای دانشجویی موازی و کم عمق می شود.این امر آکادمی را قادر می سازد تا به عمق مدل پایین (به عنوان مثال ، دو لایه) نسبت به خطوط پایه و در نتیجه کمترین تأخیر استنباط بدون تأثیرگذاری بر روی صحت ، دست یابد. برای پشت سر هم گاه به گاه ، می تواند به طور موقت تعداد دانش آموزان با حداقل از دست دادن دقت را برای بهبود توان کاهش دهد.علاوه بر این ، از طرح های تخصصی سیستم برای موازی سازی دانش آموزان استفاده می کند تا بارهای کار آنلاین تصادفی را بهتر انجام دهد.ما آزمایش های جامع را برای تأیید اثربخشی انجام می دهیم.نتایج نشان می دهد که آکادمی از خط مقدمات با تاخیر در 4.1x ~ 1.6 برابر و بدون به خطر انداختن دقت بهتر عمل می کند و تا 22.27 برابر توان بالاتر برای پشت سر هم به دست می آید.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.