ترجمه فارسی مقاله UNA: یکسان سازی ترازهای RLHF/PPO، DPO و KTO توسط یک تابع پاداش ضمنی تعمیم یافته

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی UNA: Unifying Alignments of RLHF/PPO, DPO and KTO by a Generalized Implicit Reward Function
عنوان مقاله به فارسی UNA: یکسان سازی ترازهای RLHF/PPO، DPO و KTO توسط یک تابع پاداش ضمنی تعمیم یافته
نویسندگان Zhichao Wang, Bin Bi, Can Huang, Shiva Kumar Pentyala, Zixu James Zhu, Sitaram Asur, Na Claire Cheng
فرمت مقاله انگلیسی PDF
تعداد صفحات 26
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Computation and Language,یادگیری ماشین , محاسبه و زبان ,
توضیحات Submitted 27 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده در 27 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

An LLM is pretrained on trillions of tokens, but the pretrained LLM may still generate undesired responses. To solve this problem, alignment techniques such as RLHF, DPO and KTO are proposed. However, these alignment techniques have limitations. For example, RLHF requires training the reward model and policy separately, which is complex, time-consuming, memory intensive and unstable during training processes. DPO proposes a mapping between an optimal policy and a reward, greatly simplifying the training process of RLHF. However, it can not take full advantages of a reward model and it is limited to pairwise preference data. In this paper, we propose \textbf{UN}ified \textbf{A}lignment (UNA) which unifies RLHF/PPO, DPO and KTO. Firstly, we mathematically prove that given the classical RLHF objective, the optimal policy is induced by a generalize implicit reward function. With this novel mapping between a reward model and an optimal policy, UNA can 1. unify RLHF/PPO, DPO and KTO into a supervised learning of minimizing the difference between an implicit reward and an explicit reward; 2. outperform RLHF/PPO while simplify, stabilize, speed up and reduce memory burden of RL fine-tuning process; 3. accommodate different feedback types including pairwise, binary and scalar feedback. Downstream experiments show UNA outperforms DPO, KTO and RLHF.

چکیده به فارسی (ترجمه ماشینی)

LLM بر روی تریلیون های توکن پیش بینی می شود ، اما LLM پیش ساخته هنوز ممکن است پاسخ های ناخواسته ایجاد کند.برای حل این مشکل ، تکنیک های تراز مانند RLHF ، DPO و KTO ارائه شده است.با این حال ، این تکنیک های تراز محدودیت هایی دارند.به عنوان مثال ، RLHF نیاز به آموزش مدل پاداش و سیاست به طور جداگانه دارد ، که در طی فرآیندهای آموزشی پیچیده ، وقت گیر ، فشرده و ناپایدار است.DPO نقشه برداری بین یک سیاست بهینه و پاداش را پیشنهاد می کند ، و روند آموزش RLHF را بسیار ساده می کند.با این حال ، نمی تواند مزایای کامل یک مدل پاداش را به خود اختصاص دهد و به داده های اولویت زوج محدود می شود.در این مقاله ، ما \ textbf {un} ified \ textbf {a} lignment (UNA) را پیشنهاد می کنیم که RLHF/PPO ، DPO و KTO را متحد می کند.اولا ، ما از نظر ریاضی ثابت می کنیم که با توجه به هدف کلاسیک RLHF ، سیاست بهینه توسط یک عملکرد پاداش ضمنی عمومی ایجاد می شود.با استفاده از این نقشه برداری جدید بین یک مدل پاداش و یک سیاست بهینه ، UNA می تواند 1. RLHF/PPO ، DPO و KTO را به یک یادگیری نظارت شده برای به حداقل رساندن تفاوت بین پاداش ضمنی و پاداش صریح متحد کنید.2. از RLHF/PPO بهتر عمل کنید در حالی که ساده ، تثبیت ، سرعت بخشیدن و کاهش بار حافظه فرآیند تنظیم دقیق RL.3. انواع بازخورد مختلف از جمله بازخورد زوج ، باینری و مقیاس را در خود جای دهید.آزمایشات پایین دست نشان می دهد UNA از DPO ، KTO و RLHF بهتر است.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.