ترجمه فارسی مقاله چارچوب تجزیه و تحلیل گرادیان برای پاداش دادن به مثال های خوب و مجازات بد در مدل های زبانی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی A Gradient Analysis Framework for Rewarding Good and Penalizing Bad Examples in Language Models
عنوان مقاله به فارسی چارچوب تجزیه و تحلیل گرادیان برای پاداش دادن به مثال های خوب و مجازات بد در مدل های زبانی
نویسندگان Yi-Lin Tuan, William Yang Wang
فرمت مقاله انگلیسی PDF
تعداد صفحات 17
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computation and Language,Machine Learning,Machine Learning,محاسبه و زبان , یادگیری ماشین , یادگیری ماشین ,
توضیحات Submitted 29 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده 29 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Beyond maximum likelihood estimation (MLE), the standard objective of a language model (LM) that optimizes good examples probabilities, many studies have explored ways that also penalize bad examples for enhancing the quality of output distribution, including unlikelihood training, exponential maximizing average treatment effect (ExMATE), and direct preference optimization (DPO). To systematically compare these methods and further provide a unified recipe for LM optimization, in this paper, we present a unique angle of gradient analysis of loss functions that simultaneously reward good examples and penalize bad ones in LMs. Through both mathematical results and experiments on CausalDialogue and Anthropic HH-RLHF datasets, we identify distinct functional characteristics among these methods. We find that ExMATE serves as a superior surrogate for MLE, and that combining DPO with ExMATE instead of MLE further enhances both the statistical (5-7%) and generative (+18% win rate) performance.

چکیده به فارسی (ترجمه ماشینی)

فراتر از برآورد حداکثر احتمال (MLE) ، هدف استاندارد یک مدل زبان (LM) که احتمال نمونه های خوب را بهینه می کند ، بسیاری از مطالعات روش هایی را مورد بررسی قرار داده اند که مثالهای بد را برای افزایش کیفیت توزیع خروجی ، از جمله آموزش غیرممکن ، حداکثر رساندن به حداکثر رساندن درمان متوسط ​​متوسط ​​، مجازات می کنند.اثر (exmate) ، و بهینه سازی اولویت مستقیم (DPO).برای مقایسه سیستماتیک این روش ها و ارائه یک دستور العمل یکپارچه برای بهینه سازی LM ، در این مقاله ، ما یک زاویه منحصر به فرد از تجزیه و تحلیل شیب عملکردهای از دست دادن ارائه می دهیم که همزمان به نمونه های خوب پاداش می دهند و موارد بد را در LMS مجازات می کنند.از طریق هر دو نتایج ریاضی و آزمایشات مربوط به مجموعه داده های علل و آنهایی HH-RLHF ، ویژگی های عملکردی متمایز را در بین این روش ها مشخص می کنیم.ما می دانیم که Exmate به عنوان یک جانشین برتر برای MLE خدمت می کند ، و ترکیب DPO با Exmate به جای MLE ، عملکرد آماری (5-7 ٪) و تولید (+18 ٪ نرخ برد) را بیشتر می کند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.