ترجمه فارسی مقاله توجه ایکس: بهره برداری از اختلاف اجماع در توجه از دیدگاه بهینه سازی توزیع شده

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی AttentionX: Exploiting Consensus Discrepancy In Attention from A Distributed Optimization Perspective
عنوان مقاله به فارسی توجه ایکس: بهره برداری از اختلاف اجماع در توجه از دیدگاه بهینه سازی توزیع شده
نویسندگان Guoqiang Zhang, Richard Heusdens
فرمت مقاله انگلیسی PDF
تعداد صفحات 7
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,یادگیری ماشین ,
توضیحات Submitted 9 September, 2024; v1 submitted 6 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده در 9 سپتامبر 2024 ؛V1 ارسال شده در 6 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

In this paper, we extend the standard Attention in transformer by exploiting the consensus discrepancy from a distributed optimization perspective, referred to as AttentionX. It is noted that the primal-dual method of multipliers (PDMM) \cite{Zhang16PDMM} is designed to iteratively solve a broad class of distributed optimization problems over a pear-to-pear (P2P) network, where neighbouring nodes gradually reach consensus as specified by predefined linear edge-constraints in the optimization process. In particular, at each iteration of PDMM, each node in a network first performs information-gathering from neighbours and then performs local information-fusion. From a high-level point of view, the $KQ$-softmax-based weighted summation of $V$-representations in Attention corresponds information-gathering from neighbours while the feature-processing via the feed-forward network (FFN) in transformer corresponds to local information fusion. PDMM exploits the Lagrangian multipliers to capture the historical consensus discrepancy in the form of residual errors of the linear edge-constraints, which plays a crucial role for the algorithm to converge. Inspired by PDMM, we propose AttentionX to incorporate the consensus discrepancy in the output update-expression of the standard Attention. The consensus discrepancy in AttentionX refers to the difference between the weighted summation of $V$-representations and scaled $V$-representions themselves. Experiments on ViT and nanoGPT show promising performance.

چکیده به فارسی (ترجمه ماشینی)

در این مقاله ، ما با بهره برداری از اختلاف اجماع از دیدگاه بهینه سازی توزیع شده ، که به عنوان توجه به آن گفته می شود ، توجه استاندارد را در ترانسفورماتور گسترش می دهیم.خاطرنشان می شود که روش اصلی دوتایی ضرب (PDMM) \ Cite {Zhang16PDMM} برای حل تکراری یک کلاس گسترده از مشکلات بهینه سازی توزیع شده بر روی یک شبکه گلابی به گلابی (P2P) طراحی شده است ، جایی که گره های همسایه به تدریج به اجماع می رسند.مشخص شده توسط محدودیت های خطی از پیش تعریف شده در فرآیند بهینه سازی.به طور خاص ، در هر تکرار PDMM ، هر گره در یک شبکه ابتدا جمع آوری اطلاعات را از همسایگان انجام می دهد و سپس اطلاعات محلی را انجام می دهد.از دیدگاه سطح بالا ، جمع بندی وزنی مبتنی بر $ $ $ $ $ از $ v $ در توجه به جمع آوری اطلاعات مربوط به جمع آوری اطلاعات از همسایگان در حالی که پردازش ویژگی از طریق شبکه تغذیه رو به جلو (FFN) در ترانسفورماتور مطابقت داردبه همجوشی اطلاعات محلی.PDMM از ضرب های لاگرانژی برای ضبط اختلاف اجماع تاریخی در قالب خطاهای باقیمانده از محدوده های خطی خطی بهره برداری می کند ، که نقش مهمی برای همگرایی الگوریتم دارد.با الهام از PDMM ، ما توجه را برای گنجاندن اختلاف اجماع در بیان بروزرسانی خروجی توجه استاندارد پیشنهاد می کنیم.اختلاف اجماع در توجه به تفاوت بین جمع وزنی $ v $ ارائه می دهد و خود را به $ $ نشان می دهد.آزمایشات مربوط به VIT و Nanogpt عملکرد امیدوار کننده ای را نشان می دهد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.