ترجمه فارسی مقاله ساختارشکنی که بهینه ساز خوبی برای مدل های زبانی ایجاد می کند

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Deconstructing What Makes a Good Optimizer for Language Models
عنوان مقاله به فارسی ساختارشکنی که بهینه ساز خوبی برای مدل های زبانی ایجاد می کند
نویسندگان Rosie Zhao, Depen Morwani, David Brandfonbrener, Nikhil Vyas, Sham Kakade
فرمت مقاله انگلیسی PDF
تعداد صفحات 16
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,یادگیری ماشین , هوش مصنوعی ,
توضیحات Submitted 10 July, 2024; originally announced July 2024.
توضیحات به فارسی 10 ژوئیه 2024 ارسال شد.در ابتدا ژوئیه 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Training language models becomes increasingly expensive with scale, prompting numerous attempts to improve optimization efficiency. Despite these efforts, the Adam optimizer remains the most widely used, due to a prevailing view that it is the most effective approach. We aim to compare several optimization algorithms, including SGD, Adafactor, Adam, and Lion, in the context of autoregressive language modeling across a range of model sizes, hyperparameters, and architecture variants. Our findings indicate that, except for SGD, these algorithms all perform comparably both in their optimal performance and also in terms of how they fare across a wide range of hyperparameter choices. Our results suggest to practitioners that the choice of optimizer can be guided by practical considerations like memory constraints and ease of implementation, as no single algorithm emerged as a clear winner in terms of performance or stability to hyperparameter misspecification. Given our findings, we further dissect these approaches, examining two simplified versions of Adam: a) signed momentum (Signum) which we see recovers both the performance and hyperparameter stability of Adam and b) Adalayer, a layerwise variant of Adam which we introduce to study Adam's preconditioning. Examining Adalayer leads us to the conclusion that the largest impact of Adam's preconditioning is restricted to the last layer and LayerNorm parameters, and, perhaps surprisingly, the remaining layers can be trained with SGD.

چکیده به فارسی (ترجمه ماشینی)

مدل های زبان آموزش با مقیاس به طور فزاینده ای گران می شوند و تلاش های بی شماری برای بهبود کارآیی بهینه سازی می کنند.با وجود این تلاش ها ، به دلیل دیدگاه غالب که مؤثرترین رویکرد است ، بهینه ساز آدام به طور گسترده ترین مورد استفاده باقی می ماند.هدف ما این است که چندین الگوریتم بهینه سازی ، از جمله SGD ، Adafactor ، Adam و Lion را در زمینه مدل سازی زبان اتورگرایی در طیف وسیعی از اندازه های مدل ، هایپرپارامترها و انواع معماری مقایسه کنیم.یافته های ما نشان می دهد که ، به جز SGD ، این الگوریتم ها همگی هم در عملکرد بهینه خود و هم از نظر چگونگی کرایه در طیف گسترده ای از گزینه های هایپرپارامتر عمل می کنند.نتایج ما به پزشکان نشان می دهد که انتخاب بهینه ساز می تواند با ملاحظات عملی مانند محدودیت های حافظه و سهولت اجرای ، هدایت شود ، زیرا هیچ الگوریتم واحد به عنوان یک برنده واضح از نظر عملکرد یا پایداری در اشتباه غلط هایپرپارامتر ظاهر نمی شود.با توجه به یافته های ما ، ما این رویکردها را بیشتر تفکیک می کنیم و دو نسخه ساده از آدم را بررسی می کنیم: الف) حرکت امضا شده (Signum) که می بینیم عملکرد و پایداری هایپرپارامتر آدم و ب) آدالیر را بازیابی می کند ، یک نوع لایه ای از آدم که ما با آن معرفی می کنیمپیش شرط آدم را مطالعه کنید.بررسی آدالیر ما را به این نتیجه می رساند که بزرگترین تأثیر پیش شرط آدم به پارامترهای لایه آخر و لایه لایه محدود شده است ، و شاید با کمال تعجب ، لایه های باقیمانده با SGD قابل آموزش باشند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.