ترجمه فارسی مقاله به سمت تراز قوی مدل‌های زبان: بهینه‌سازی اولویت مستقیم از نظر توزیعی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
عنوان مقاله به فارسی به سمت تراز قوی مدل‌های زبان: بهینه‌سازی اولویت مستقیم از نظر توزیعی
نویسندگان Junkang Wu, Yuexiang Xie, Zhengyi Yang, Jiancan Wu, Jiawei Chen, Jinyang Gao, Bolin Ding, Xiang Wang, Xiangnan He
فرمت مقاله انگلیسی PDF
تعداد صفحات 24
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,Computation and Language,یادگیری ماشین , هوش مصنوعی , محاسبات و زبان ,
توضیحات Submitted 10 July, 2024; originally announced July 2024.
توضیحات به فارسی 10 ژوئیه 2024 ارسال شد.در ابتدا ژوئیه 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

This study addresses the challenge of noise in training datasets for Direct Preference Optimization (DPO), a method for aligning Large Language Models (LLMs) with human preferences. We categorize noise into pointwise noise, which includes low-quality data points, and pairwise noise, which encompasses erroneous data pair associations that affect preference rankings. Utilizing Distributionally Robust Optimization (DRO), we enhance DPO's resilience to these types of noise. Our theoretical insights reveal that DPO inherently embeds DRO principles, conferring robustness to pointwise noise, with the regularization coefficient $β$ playing a critical role in its noise resistance. Extending this framework, we introduce Distributionally Robustifying DPO (Dr. DPO), which integrates pairwise robustness by optimizing against worst-case pairwise scenarios. The novel hyperparameter $β'$ in Dr. DPO allows for fine-tuned control over data pair reliability, providing a strategic balance between exploration and exploitation in noisy training environments. Empirical evaluations demonstrate that Dr. DPO substantially improves the quality of generated text and response accuracy in preference datasets, showcasing enhanced performance in both noisy and noise-free settings. The code is available at https://github.com/junkangwu/Dr_DPO.

چکیده به فارسی (ترجمه ماشینی)

این مطالعه به چالش نویز در مجموعه داده های آموزش برای بهینه سازی اولویت مستقیم (DPO) ، روشی برای تراز کردن مدلهای بزرگ زبان (LLM) با ترجیحات انسانی می پردازد.ما نویز را به سر و صدای نقطه ای طبقه بندی می کنیم ، که شامل نقاط داده با کیفیت پایین و نویز زوجی است ، که شامل انجمن های جفت داده های نادرست است که بر رتبه اولویت تأثیر می گذارد.با استفاده از بهینه سازی توزیع کننده (DRO) ، ما مقاومت DPO را نسبت به این نوع نویزها تقویت می کنیم.بینش های نظری ما نشان می دهد که DPO ذاتاً اصول DRO را تعبیه می کند ، استحکام را به سر و صدای اشاره می کند ، با ضریب تنظیم $ β $ نقش مهمی در مقاومت در برابر سر و صدا دارد.با گسترش این چارچوب ، ما DPO (دکتر DPO) را که به طور کلی قوی است ، معرفی می کنیم ، که با بهینه سازی در برابر سناریوهای زوج بدترین حالت ، استحکام زوج را ادغام می کند.رمان Hyperparameter $ β '$ در دکتر DPO امکان کنترل دقیق بر قابلیت اطمینان جفت داده ها را فراهم می کند ، و تعادل استراتژیک بین اکتشاف و بهره برداری در محیط های آموزش پر سر و صدا را فراهم می کند.ارزیابی های تجربی نشان می دهد که دکتر DPO به طور قابل ملاحظه ای کیفیت متن تولید شده و دقت پاسخ را در مجموعه داده های اولویت بهبود می بخشد و عملکرد پیشرفته را در هر دو تنظیمات پر سر و صدا و بدون سر و صدا نشان می دهد.این کد در https://github.com/junkangwu/dr_dpo در دسترس است.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.