ترجمه فارسی مقاله تئوری، تجزیه و تحلیل، و بهترین شیوه ها برای خود توجهی سیگموئید

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Theory, Analysis, and Best Practices for Sigmoid Self-Attention
عنوان مقاله به فارسی تئوری، تجزیه و تحلیل، و بهترین شیوه ها برای خود توجهی سیگموئید
نویسندگان Jason Ramapuram, Federico Danieli, Eeshan Dhekane, Floris Weers, Dan Busbridge, Pierre Ablin, Tatiana Likhomanenko, Jagrit Digani, Zijin Gu, Amitis Shidani, Russ Webb
فرمت مقاله انگلیسی PDF
تعداد صفحات 53
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,یادگیری ماشین ,
توضیحات Submitted 6 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده در 6 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Attention is a key part of the transformer architecture. It is a sequence-to-sequence mapping that transforms each sequence element into a weighted sum of values. The weights are typically obtained as the softmax of dot products between keys and queries. Recent work has explored alternatives to softmax attention in transformers, such as ReLU and sigmoid activations. In this work, we revisit sigmoid attention and conduct an in-depth theoretical and empirical analysis. Theoretically, we prove that transformers with sigmoid attention are universal function approximators and benefit from improved regularity compared to softmax attention. Through detailed empirical analysis, we identify stabilization of large initial attention norms during the early stages of training as a crucial factor for the successful training of models with sigmoid attention, outperforming prior attempts. We also introduce FLASHSIGMOID, a hardware-aware and memory-efficient implementation of sigmoid attention yielding a 17% inference kernel speed-up over FLASHATTENTION2 on H100 GPUs. Experiments across language, vision, and speech show that properly normalized sigmoid attention matches the strong performance of softmax attention on a wide range of domains and scales, which previous attempts at sigmoid attention were unable to fully achieve. Our work unifies prior art and establishes best practices for sigmoid attention as a drop-in softmax replacement in transformers.

چکیده به فارسی (ترجمه ماشینی)

توجه بخش مهمی از معماری ترانسفورماتور است.این یک نقشه برداری دنباله به توالی است که هر عنصر دنباله را به یک مقدار وزنی از مقادیر تبدیل می کند.وزن ها به طور معمول به عنوان نرم افزار محصولات DOT بین کلیدها و نمایش داده ها بدست می آیند.کارهای اخیر گزینه های مورد نظر برای توجه SoftMax در ترانسفورماتورها ، مانند فعال سازی Relu و Sigmoid را مورد بررسی قرار داده است.در این کار ، ما توجه سیگموئید را دوباره مورد بررسی قرار می دهیم و یک تحلیل نظری و تجربی عمیق را انجام می دهیم.از لحاظ تئوریکی ، ما ثابت می کنیم که ترانسفورماتورها با توجه سیگموئید تقریب عملکرد جهانی هستند و در مقایسه با توجه Softmax از نظم و منظم بهبود یافته بهره مند می شوند.از طریق تجزیه و تحلیل تجربی دقیق ، ما تثبیت هنجارهای بزرگ توجه اولیه را در مراحل اولیه آموزش به عنوان یک عامل مهم برای آموزش موفقیت آمیز مدل ها با توجه سیگموئید ، از تلاشهای قبلی پیش بینی می کنیم.ما همچنین FlashSigmoid را معرفی می کنیم ، یک اجرای سخت افزاری و کارآیی حافظه از توجه سیگموئید که دارای سرعت هسته استنباط 17 ٪ نسبت به Flashattion2 در GPU H100 است.آزمایشات در سراسر زبان ، بینایی و گفتار نشان می دهد که توجه سیگموئید به درستی نرمال با عملکرد قوی توجه SoftMax در طیف گسترده ای از دامنه ها و مقیاس ها مطابقت دارد ، که تلاش های قبلی برای توجه سیگموئید قادر به دستیابی کامل نبود.کار ما هنر قبلی را متحد می کند و بهترین شیوه ها را برای توجه سیگموئید به عنوان جایگزینی SoftMax در ترانسفورماتورها ایجاد می کند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.