ترجمه فارسی مقاله TSO: خودآموزی با بهینه سازی اولویت های مقیاس شده

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی TSO: Self-Training with Scaled Preference Optimization
عنوان مقاله به فارسی TSO: خودآموزی با بهینه سازی اولویت های مقیاس شده
نویسندگان Kaihui Chen, Hao Yi, Qingyang Li, Tianyu Qi, Yulan Hu, Fuzheng Zhang, Yong Liu
فرمت مقاله انگلیسی PDF
تعداد صفحات 19
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,Computation and Language,یادگیری ماشین , هوش مصنوعی , محاسبات و زبان ,
توضیحات Submitted 31 August, 2024; originally announced September 2024.
توضیحات به فارسی ارسال 31 اوت 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Enhancing the conformity of large language models (LLMs) to human preferences remains an ongoing research challenge. Recently, offline approaches such as Direct Preference Optimization (DPO) have gained prominence as attractive options due to offering effective improvement in simple, efficient, and stable without interactions with reward models. However, these offline preference optimization methods highly rely on the quality of pairwise preference samples. Meanwhile, numerous iterative methods require additional training of reward models to select positive and negative samples from the model's own generated responses for preference learning. Furthermore, as LLMs' capabilities advance, it is quite challenging to continuously construct high-quality positive and negative preference instances from the model's outputs due to the lack of diversity. To tackle these challenges, we propose TSO, or Self-Training with Scaled Preference Optimization, a framework for preference optimization that conducts self-training preference learning without training an additional reward model. TSO enhances the diversity of responses by constructing a model matrix and incorporating human preference responses. Furthermore, TSO introduces corrections for model preference errors through human and AI feedback. Finally, TSO adopts iterative and dual clip reward strategies to update the reference model and its responses, adaptively adjusting preference data and balancing the optimization process. Experimental results demonstrate that TSO outperforms existing mainstream methods on various alignment evaluation benchmarks, providing practical insight into preference data construction and model training strategies in the alignment domain.

چکیده به فارسی (ترجمه ماشینی)

تقویت انطباق مدل های بزرگ زبان (LLMS) با ترجیحات انسانی یک چالش تحقیقاتی مداوم است.اخیراً ، رویکردهای آفلاین مانند بهینه سازی اولویت مستقیم (DPO) به دلیل ارائه بهبود مؤثر در ساده ، کارآمد و پایدار و بدون تعامل با مدل های پاداش ، به عنوان گزینه های جذاب به عنوان گزینه های جذاب به دست آورده اند.با این حال ، این روشهای بهینه سازی اولویت آفلاین بسیار به کیفیت نمونه های اولویت زوج متکی هستند.در همین حال ، بسیاری از روش های تکراری نیاز به آموزش اضافی از مدل های پاداش برای انتخاب نمونه های مثبت و منفی از پاسخ های تولید شده مدل برای یادگیری اولویت دارند.علاوه بر این ، با پیشرفت قابلیت های LLMS ، ساخت مداوم نمونه های اولویت مثبت و منفی با کیفیت بالا از خروجی های مدل به دلیل عدم تنوع بسیار چالش برانگیز است.برای مقابله با این چالش ها ، ما TSO یا خودآموزی را با بهینه سازی ترجیح مقیاس پیشنهاد می کنیم ، چارچوبی برای بهینه سازی اولویت که یادگیری اولویت خود را انجام می دهد بدون آموزش یک مدل پاداش اضافی.TSO با ساخت یک ماتریس مدل و ترکیب پاسخ های اولویت انسانی ، تنوع پاسخ ها را تقویت می کند.علاوه بر این ، TSO اصلاحاتی را برای خطاهای اولویت مدل از طریق بازخورد انسان و هوش مصنوعی ارائه می دهد.سرانجام ، TSO برای به روزرسانی مدل مرجع و پاسخ های آن ، تنظیم داده های ترجیح و تعادل فرایند بهینه سازی ، استراتژی های پاداش کلیپ تکراری و دوگانه را برای به روزرسانی مدل مرجع و پاسخ های آن اتخاذ می کند.نتایج تجربی نشان می دهد که TSO از روشهای اصلی اصلی موجود در معیارهای مختلف ارزیابی تراز ، بهتر است ، بینش عملی در مورد ساخت داده های ترجیحی و استراتژی های آموزش مدل در حوزه تراز ارائه می دهد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.