ترجمه فارسی مقاله زمان‌بندی قدرت: زمان‌بندی نرخ یادگیری آگنوستیک با اندازه دسته و شماره رمز

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Power Scheduler: A Batch Size and Token Number Agnostic Learning Rate Scheduler
عنوان مقاله به فارسی زمان‌بندی قدرت: زمان‌بندی نرخ یادگیری آگنوستیک با اندازه دسته و شماره رمز
نویسندگان Yikang Shen, Matthew Stallone, Mayank Mishra, Gaoyuan Zhang, Shawn Tan, Aditya Prasad, Adriana Meza Soria, David D. Cox, Rameswar Panda
فرمت مقاله انگلیسی PDF
تعداد صفحات 12
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computation and Language,Artificial Intelligence,Machine Learning,محاسبه و زبان , هوش مصنوعی , یادگیری ماشین ,
توضیحات Submitted 11 September, 2024; v1 submitted 23 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده در 11 سپتامبر 2024 ؛V1 ارسال شده 23 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Finding the optimal learning rate for language model pretraining is a challenging task. This is not only because there is a complicated correlation between learning rate, batch size, number of training tokens, model size, and other hyperparameters but also because it is prohibitively expensive to perform a hyperparameter search for large language models with Billions or Trillions of parameters. Recent studies propose using small proxy models and small corpus to perform hyperparameter searches and transposing the optimal parameters to large models and large corpus. While the zero-shot transferability is theoretically and empirically proven for model size related hyperparameters, like depth and width, the zero-shot transfer from small corpus to large corpus is underexplored. In this paper, we study the correlation between optimal learning rate, batch size, and number of training tokens for the recently proposed WSD scheduler. After thousands of small experiments, we found a power-law relationship between variables and demonstrated its transferability across model sizes. Based on the observation, we propose a new learning rate scheduler, Power scheduler, that is agnostic about the number of training tokens and batch size. The experiment shows that combining the Power scheduler with Maximum Update Parameterization (muP) can consistently achieve impressive performance with one set of hyperparameters regardless of the number of training tokens, batch size, model size, and even model architecture. Our 3B dense and MoE models trained with the Power scheduler achieve comparable performance as state-of-the-art small language models. We open-source these pretrained models at https://ibm.biz/BdKhLa.

چکیده به فارسی (ترجمه ماشینی)

یافتن نرخ یادگیری بهینه برای پیش بینی مدل زبان یک کار چالش برانگیز است.این تنها به این دلیل است که بین میزان یادگیری ، اندازه دسته ای ، تعداد نشانه های آموزش ، اندازه مدل و سایر هاپرپارامترها همبستگی پیچیده ای وجود دارد ، بلکه به این دلیل که انجام یک جستجوی هایپرپارامتر برای مدل های بزرگ زبان با میلیاردها یا تریلیون پارامتر بسیار گران استبشرمطالعات اخیر با استفاده از مدلهای پراکسی کوچک و بدنه های کوچک برای انجام جستجوهای هایپرپارامتر و انتقال پارامترهای بهینه به مدلهای بزرگ و بدنه های بزرگ پیشنهاد می شود.در حالی که قابلیت انتقال صفر از نظر تئوری و تجربی برای هایپرپارامترهای مربوط به اندازه مدل مانند عمق و عرض اثبات شده است ، انتقال صفر از جسد کوچک به جسد بزرگ از بین می رود.در این مقاله ، ما همبستگی بین میزان یادگیری بهینه ، اندازه دسته ای و تعداد نشانه های آموزشی را برای برنامه ریز WSD که اخیراً ارائه شده است ، بررسی می کنیم.پس از هزاران آزمایش کوچک ، ما یک رابطه قدرت بین متغیرها پیدا کردیم و قابلیت انتقال آن را در اندازه مدل نشان دادیم.بر اساس مشاهده ، ما یک برنامه ریزی جدید نرخ یادگیری ، برنامه ریزی قدرت را پیشنهاد می کنیم ، که در مورد تعداد نشانه های آموزش و اندازه دسته ای آگنوستیک است.این آزمایش نشان می دهد که ترکیب برنامه ریز برق با حداکثر پارامتر سازی به روزرسانی (MUP) می تواند به طور مداوم با یک مجموعه از هاپرپارامترها بدون توجه به تعداد نشانه های آموزش ، اندازه دسته ای ، اندازه مدل و حتی معماری مدل ، به عملکرد چشمگیر برسد.مدل های متراکم و MOE 3B ما که با برنامه ریزی قدرت آموزش دیده اند ، به عنوان مدلهای پیشرفته زبان کوچک ، عملکرد قابل مقایسه ای کسب می کنند.ما این مدل های پیش ساخته را در https://ibm.biz/bdkhla باز می کنیم.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.