ترجمه فارسی مقاله در مورد قابلیت تعمیم محدود مدل پاداش ضمنی ناشی از بهینه سازی اولویت مستقیم

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization
عنوان مقاله به فارسی در مورد قابلیت تعمیم محدود مدل پاداش ضمنی ناشی از بهینه سازی اولویت مستقیم
نویسندگان Yong Lin, Skyler Seto, Maartje ter Hoeve, Katherine Metcalf, Barry-John Theobald, Xuan Wang, Yizhe Zhang, Chen Huang, Tong Zhang
فرمت مقاله انگلیسی PDF
تعداد صفحات 12
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Computation and Language,یادگیری ماشین , محاسبه و زبان ,
توضیحات Submitted 5 September, 2024; originally announced September 2024. , Comments: 12 pages, 8 tables, 2 figures
توضیحات به فارسی ارسال شده در 5 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد ، نظرات: 12 صفحه ، 8 جدول ، 2 شکل
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Reinforcement Learning from Human Feedback (RLHF) is an effective approach for aligning language models to human preferences. Central to RLHF is learning a reward function for scoring human preferences. Two main approaches for learning a reward model are 1) training an EXplicit Reward Model (EXRM) as in RLHF, and 2) using an implicit reward learned from preference data through methods such as Direct Preference Optimization (DPO). Prior work has shown that the implicit reward model of DPO (denoted as DPORM) can approximate an EXRM in the limit. DPORM's effectiveness directly implies the optimality of the learned policy, and also has practical implication for LLM alignment methods including iterative DPO. However, it is unclear how well DPORM empirically matches the performance of EXRM. This work studies the accuracy at distinguishing preferred and rejected answers for both DPORM and EXRM. Our findings indicate that even though DPORM fits the training dataset comparably, it generalizes less effectively than EXRM, especially when the validation datasets contain distribution shifts. Across five out-of-distribution settings, DPORM has a mean drop in accuracy of 3% and a maximum drop of 7%. These findings highlight that DPORM has limited generalization ability and substantiates the integration of an explicit reward model in iterative DPO approaches.

چکیده به فارسی (ترجمه ماشینی)

یادگیری تقویت از بازخورد انسان (RLHF) یک رویکرد مؤثر برای تراز کردن مدلهای زبان به ترجیحات انسانی است.اصلی برای RLHF یادگیری یک تابع پاداش برای به ثمر رساندن ترجیحات انسانی است.دو رویکرد اصلی برای یادگیری یک مدل پاداش 1) آموزش یک مدل پاداش صریح (EXRM) مانند RLHF و 2) با استفاده از یک پاداش ضمنی که از داده های اولویت از طریق روش هایی مانند بهینه سازی اولویت مستقیم (DPO) آموخته می شود.کار قبلی نشان داده است که مدل پاداش ضمنی DPO (مشخص شده به عنوان DPORM) می تواند EXRM را در حد مجاز تقریبی کند.اثربخشی DPORM به طور مستقیم دلالت بر بهینه بودن سیاست آموخته است ، و همچنین پیامدهای عملی برای روشهای تراز LLM از جمله DPO تکراری دارد.با این حال ، مشخص نیست که DPORM به طور تجربی با عملکرد EXRM مطابقت دارد.این کار صحت در تمایز پاسخ های ارجح و رد شده برای DPORM و EXRM را بررسی می کند.یافته های ما نشان می دهد که حتی اگر DPORM متناسب با مجموعه داده های آموزشی باشد ، اما کمتر از EXRM تعمیم می یابد ، به ویژه هنگامی که مجموعه داده های اعتبارسنجی حاوی تغییرات توزیع هستند.در پنج تنظیم خارج از توزیع ، DPORM دارای میانگین کاهش دقت 3 ٪ و حداکثر افت 7 ٪ است.این یافته ها نشان می دهد که DPORM توانایی تعمیم محدودی دارد و ادغام یک مدل پاداش صریح را در رویکردهای تکراری DPO اثبات می کند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.