ترجمه فارسی مقاله مدل سازی پاداش نیمه تحت نظارت از طریق خودآموزی تکراری

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Semi-Supervised Reward Modeling via Iterative Self-Training
عنوان مقاله به فارسی مدل سازی پاداش نیمه تحت نظارت از طریق خودآموزی تکراری
نویسندگان Yifei He, Haoxiang Wang, Ziyan Jiang, Alexandros Papangelis, Han Zhao
فرمت مقاله انگلیسی PDF
تعداد صفحات 13
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,یادگیری ماشین ,
توضیحات Submitted 10 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده 10 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Reward models (RM) capture the values and preferences of humans and play a central role in Reinforcement Learning with Human Feedback (RLHF) to align pretrained large language models (LLMs). Traditionally, training these models relies on extensive human-annotated preference data, which poses significant challenges in terms of scalability and cost. To overcome these limitations, we propose Semi-Supervised Reward Modeling (SSRM), an approach that enhances RM training using unlabeled data. Given an unlabeled dataset, SSRM involves three key iterative steps: pseudo-labeling unlabeled examples, selecting high-confidence examples through a confidence threshold, and supervised finetuning on the refined dataset. Across extensive experiments on various model configurations, we demonstrate that SSRM significantly improves reward models without incurring additional labeling costs. Notably, SSRM can achieve performance comparable to models trained entirely on labeled data of equivalent volumes. Overall, SSRM substantially reduces the dependency on large volumes of human-annotated data, thereby decreasing the overall cost and time involved in training effective reward models.

چکیده به فارسی (ترجمه ماشینی)

مدل های پاداش (RM) مقادیر و ترجیحات انسان را ضبط می کنند و نقش مهمی در یادگیری تقویت با بازخورد انسان (RLHF) برای تراز کردن مدلهای زبان بزرگ پیش ساخته (LLMS) دارند.به طور سنتی ، آموزش این مدلها به داده های گسترده ای از ترجیح انسان متکی است ، که از نظر مقیاس پذیری و هزینه چالش های قابل توجهی را ایجاد می کند.برای غلبه بر این محدودیت ها ، ما مدل سازی پاداش نیمه تحت نظارت (SSRM) را پیشنهاد می کنیم ، رویکردی که آموزش RM را با استفاده از داده های بدون برچسب تقویت می کند.با توجه به یک مجموعه داده بدون برچسب ، SSRM شامل سه مرحله تکراری مهم است: نمونه های بدون برچسب شبه ، انتخاب نمونه های اعتماد به نفس بالا از طریق آستانه اطمینان ، و نظارت بر روی داده های تصفیه شده.در طول آزمایش های گسترده در مورد تنظیمات مختلف مدل ، ما نشان می دهیم که SSRM مدلهای پاداش را بدون تحمل هزینه های اضافی برچسب گذاری بهبود می بخشد.نکته قابل توجه ، SSRM می تواند به عملکرد قابل مقایسه با مدلهایی که کاملاً بر روی داده های برچسب زده شده از حجم های معادل آموزش داده می شوند ، دست یابد.به طور کلی ، SSRM به طور قابل توجهی وابستگی به حجم زیادی از داده های نانوخته شده انسان را کاهش می دهد ، در نتیجه هزینه کلی و زمان درگیر در آموزش مدلهای پاداش مؤثر را کاهش می دهد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.