ترجمه فارسی مقاله حساسیت زدایی طول در بهینه سازی ترجیح کارگردانی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Length Desensitization in Directed Preference Optimization
عنوان مقاله به فارسی حساسیت زدایی طول در بهینه سازی ترجیح کارگردانی
نویسندگان Wei Liu, Yang Bai, Chengcheng Han, Rongxiang Weng, Jun Xu, Xuezhi Cao, Jingang Wang, Xunliang Cai
فرمت مقاله انگلیسی PDF
تعداد صفحات 21
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Computation and Language,یادگیری ماشین , محاسبه و زبان ,
توضیحات Submitted 10 September, 2024; originally announced September 2024. , Comments: 21 pages, 9 figures
توضیحات به فارسی ارسال شده 10 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد ، نظرات: 21 صفحه ، 9 شکل
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Direct Preference Optimization (DPO) is widely utilized in the Reinforcement Learning from Human Feedback (RLHF) phase to align Large Language Models (LLMs) with human preferences, thereby enhancing both their harmlessness and efficacy. However, it has been observed that DPO tends to over-optimize for verbosity, which can detrimentally affect both performance and user experience. In this paper, we conduct an in-depth theoretical analysis of DPO's optimization objective and reveal a strong correlation between its implicit reward and data length. This correlation misguides the optimization direction, resulting in length sensitivity during the DPO training and leading to verbosity. To address this issue, we propose a length-desensitization improvement method for DPO, termed LD-DPO. The proposed method aims to desensitize DPO to data length by decoupling explicit length preference, which is relatively insignificant, from the other implicit preferences, thereby enabling more effective learning of the intrinsic preferences. We utilized two settings (Base and Instruct) of Llama2-13B, Llama3-8B, and Qwen2-7B for experimental validation on various benchmarks including MT-Bench and AlpacaEval 2. The experimental results indicate that LD-DPO consistently outperforms DPO and other baseline methods, achieving more concise responses with a 10-40\% reduction in length compared to DPO. We conducted in-depth experimental analyses to demonstrate that LD-DPO can indeed achieve length desensitization and align the model more closely with human-real preferences.

چکیده به فارسی (ترجمه ماشینی)

بهینه سازی اولویت مستقیم (DPO) به طور گسترده ای در یادگیری تقویت کننده از فاز بازخورد انسان (RLHF) برای تراز کردن مدلهای بزرگ زبان (LLM) با ترجیحات انسانی مورد استفاده قرار می گیرد و از این طریق هم بی ضرر و هم اثربخشی آنها را تقویت می کند.با این حال ، مشاهده شده است که DPO تمایل به بهینه سازی بیش از حد برای کلامی دارد ، که می تواند به طرز مضر بر عملکرد و تجربه کاربر تأثیر بگذارد.در این مقاله ، ما یک تجزیه و تحلیل نظری عمیق از هدف بهینه سازی DPO انجام می دهیم و همبستگی قوی بین پاداش ضمنی و طول داده ها را نشان می دهیم.این همبستگی جهت بهینه سازی را گمراه می کند و در نتیجه حساسیت طول در طول آموزش DPO و منجر به کلامی می شود.برای پرداختن به این مسئله ، ما یک روش بهبود حساس به طول برای DPO ، به نام LD-DPO را پیشنهاد می کنیم.روش پیشنهادی با هدف جدا کردن DPO به طول داده ها با جدا کردن ترجیح طول صریح ، که نسبتاً ناچیز است ، از دیگر ترجیحات ضمنی ، از این طریق یادگیری مؤثرتر از ترجیحات ذاتی را فراهم می کند.ما از دو تنظیم (پایه و دستورالعمل) LLAMA2-13B ، LLAMA3-8B و QWEN2-7B برای اعتبار سنجی تجربی در معیارهای مختلف از جمله MT-Bench و Alpacaeval 2 استفاده کردیم. نتایج تجربی نشان می دهد که LD-DPO به طور مداوم از DPO و سایر موارد پایه خارج می شود.روشها ، دستیابی به پاسخهای مختصر تر با کاهش 10-40 \ ٪ در مقایسه با DPO.ما تجزیه و تحلیل های تجربی عمیق را انجام دادیم تا نشان دهیم که LD-DPO در واقع می تواند به حساسیت زدایی طول برسد و مدل را با ترجیحات واقعی انسانی نزدیک تر کند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.