ترجمه فارسی مقاله مدل‌های پاداش با صدای بلند را نقد کنید

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

عنوان مقاله به انگلیسی Critique-out-Loud Reward Models
عنوان مقاله به فارسی مدل‌های پاداش با صدای بلند را نقد کنید
نویسندگان Zachary Ankner, Mansheej Paul, Brandon Cui, Jonathan D. Chang, Prithviraj Ammanabrolu
فرمت مقاله انگلیسی PDF
تعداد صفحات 24
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,یادگیری ماشین ,
توضیحات Submitted 21 August, 2024; originally announced August 2024.
توضیحات به فارسی ارائه شده 21 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Traditionally, reward models used for reinforcement learning from human feedback (RLHF) are trained to directly predict preference scores without leveraging the generation capabilities of the underlying large language model (LLM). This limits the capabilities of reward models as they must reason implicitly about the quality of a response, i.e., preference modeling must be performed in a single forward pass through the model. To enable reward models to reason explicitly about the quality of a response, we introduce Critique-out-Loud (CLoud) reward models. CLoud reward models operate by first generating a natural language critique of the assistant's response that is then used to predict a scalar reward for the quality of the response. We demonstrate the success of CLoud reward models for both Llama-3-8B and 70B base models: compared to classic reward models CLoud reward models improve pairwise preference classification accuracy on RewardBench by 4.65 and 5.84 percentage points for the 8B and 70B base models respectively. Furthermore, CLoud reward models lead to a Pareto improvement for win rate on ArenaHard when used as the scoring model for Best-of-N. Finally, we explore how to exploit the dynamic inference compute capabilities of CLoud reward models by performing self-consistency decoding for reward prediction.

چکیده به فارسی (ترجمه ماشینی)

به طور سنتی ، مدل های پاداش مورد استفاده برای یادگیری تقویت از بازخورد انسان (RLHF) آموزش می گیرند تا مستقیماً نمرات اولویت را بدون استفاده از قابلیت های تولید مدل بزرگ زبان (LLM) پیش بینی کنند.این قابلیت های مدل های پاداش را محدود می کند ، زیرا آنها باید به طور ضمنی در مورد کیفیت یک پاسخ استدلال کنند ، یعنی مدل سازی ترجیح باید در یک پاس به جلو از طریق مدل انجام شود.برای فعال کردن مدل های پاداش به صراحت در مورد کیفیت یک پاسخ ، ما مدل های پاداش با صدای بلند (ابر) را معرفی می کنیم.مدل های پاداش ابر با ایجاد اولین نقد زبان طبیعی از پاسخ دستیار عمل می کنند که سپس برای پیش بینی پاداش مقیاس برای کیفیت پاسخ استفاده می شود.ما موفقیت مدل های پاداش ابر را برای هر دو مدل پایه LLAMA-3-8B و 70B نشان می دهیم: در مقایسه با مدل های پاداش کلاسیک مدل های پاداش ابر ، دقت طبقه بندی ترجیح زوج را در READBENCH با 4.65 و 5.84 درصد برای مدل های پایه 8B و 70B بهبود می بخشند.علاوه بر این ، مدل های پاداش Cloud منجر به بهبود پارتو برای نرخ پیروزی در Arenahard می شوند که به عنوان مدل امتیاز دهی برای بهترین- N استفاده می شود.سرانجام ، ما چگونگی سوءاستفاده از قابلیت های محاسبه استنتاج پویا مدل های پاداش ابر را با انجام رمزگشایی خود با خود برای پیش بینی پاداش بررسی می کنیم.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.