ترجمه فارسی مقاله از لیست گرفته تا ایموجی ها: چگونه سوگیری الگو بر تراز مدل تأثیر می گذارد

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

عنوان مقاله به انگلیسی From Lists to Emojis: How Format Bias Affects Model Alignment
عنوان مقاله به فارسی از لیست گرفته تا ایموجی ها: چگونه سوگیری الگو بر تراز مدل تأثیر می گذارد
نویسندگان Xuanchang Zhang, Wei Xiong, Lichang Chen, Tianyi Zhou, Heng Huang, Tong Zhang
فرمت مقاله انگلیسی PDF
تعداد صفحات 18
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computation and Language,Machine Learning,محاسبه و زبان , یادگیری ماشین ,
توضیحات Submitted 18 September, 2024; originally announced September 2024. , Comments: Working in progress
توضیحات به فارسی ارائه شده در 18 سپتامبر 2024 ؛در ابتدا در سپتامبر 2024 اعلام شد ، نظرات: کار در حال انجام
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

In this paper, we study format biases in reinforcement learning from human feedback (RLHF). We observe that many widely-used preference models, including human evaluators, GPT-4, and top-ranking models on the RewardBench benchmark, exhibit strong biases towards specific format patterns, such as lists, links, bold text, and emojis. Furthermore, large language models (LLMs) can exploit these biases to achieve higher rankings on popular benchmarks like AlpacaEval and LMSYS Chatbot Arena. One notable example of this is verbosity bias, where current preference models favor longer responses that appear more comprehensive, even when their quality is equal to or lower than shorter, competing responses. However, format biases beyond verbosity remain largely underexplored in the literature. In this work, we extend the study of biases in preference learning beyond the commonly recognized length bias, offering a comprehensive analysis of a wider range of format biases. Additionally, we show that with a small amount of biased data (less than 1%), we can inject significant bias into the reward model. Moreover, these format biases can also be easily exploited by downstream alignment algorithms, such as best-of-n sampling and online iterative DPO, as it is usually easier to manipulate the format than to improve the quality of responses. Our findings emphasize the need to disentangle format and content both for designing alignment algorithms and evaluating models.

چکیده به فارسی (ترجمه ماشینی)

در این مقاله ، ما تعصبات قالب را در یادگیری تقویت از بازخورد انسان (RLHF) مطالعه می کنیم.ما مشاهده می کنیم که بسیاری از مدلهای اولویت بسیار مورد استفاده ، از جمله ارزیابی کنندگان انسانی ، GPT-4 و مدل های برتر در معیار پاداش ، تعصبات محکمی نسبت به الگوهای فرمت خاص مانند لیست ها ، پیوندها ، متن جسورانه و ایموجی ها نشان می دهند.علاوه بر این ، مدل های بزرگ زبان (LLMS) می توانند از این تعصبات برای دستیابی به رده بندی های بالاتر در معیارهای محبوب مانند Alpacaeval و LMSYS Chatbot Arena استفاده کنند.یکی از نمونه های قابل توجه این تعصب کلامی است ، جایی که مدلهای اولویت فعلی پاسخ های طولانی تری دارند که جامع تر به نظر می رسند ، حتی اگر کیفیت آنها برابر یا پایین تر از پاسخ های رقابتی باشد.با این حال ، تعصبات فرمت فراتر از کلامی تا حد زیادی در ادبیات مورد استفاده قرار نمی گیرد.در این کار ، ما مطالعه تعصبات را در یادگیری اولویت فراتر از تعصب طول متداول گسترش می دهیم ، و تجزیه و تحلیل کاملی از طیف گسترده تری از تعصبات فرمت ارائه می دهیم.علاوه بر این ، ما نشان می دهیم که با مقدار کمی از داده های مغرضانه (کمتر از 1 ٪) ، می توانیم تعصب قابل توجهی را به مدل پاداش تزریق کنیم.علاوه بر این ، این تعصبات قالب نیز می توانند به راحتی توسط الگوریتم های تراز پایین دست ، مانند نمونه برداری از بهترین و N و DPO تکراری آنلاین مورد سوء استفاده قرار گیرند ، زیرا معمولاً دستکاری این قالب ساده تر از بهبود کیفیت پاسخ ها است.یافته های ما بر لزوم جدا کردن قالب و محتوا هم برای طراحی الگوریتم های تراز و ارزیابی مدل ها تأکید دارد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.