ترجمه فارسی مقاله یادگیری تقویتی بدون بازخورد انسانی برای آخرین مایل تنظیم دقیق مدل های زبان بزرگ

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Reinforcement Learning without Human Feedback for Last Mile Fine-Tuning of Large Language Models
عنوان مقاله به فارسی یادگیری تقویتی بدون بازخورد انسانی برای آخرین مایل تنظیم دقیق مدل های زبان بزرگ
نویسندگان Alec Solway
فرمت مقاله انگلیسی PDF
تعداد صفحات 8
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computation and Language,Machine Learning,محاسبه و زبان , یادگیری ماشین ,
توضیحات Submitted 29 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده 29 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Reinforcement learning is used to align language models with human preference signals after first pre-training the model to predict the next token of text within a large corpus using likelihood maximization. Before being deployed in a specific domain, models are often further fine-tuned on task specific data. Since human preferences are often unavailable for the last step, it is performed using likelihood maximization as that is the typical default method. However, reinforcement learning has other advantages besides facilitating alignment to a human derived reward function. For one, whereas likelihood maximization is a form of imitation learning in which the model is trained on what to do under ideal conditions, reinforcement learning is not limited to demonstrating actions just for optimally reached states and trains a model what to do under a range of scenarios as it explores the policy space. In addition, it also trains a model what not to do, suppressing competitive but poor actions. This work develops a framework for last-mile fine-tuning using reinforcement learning and tests whether it garners performance gains. The experiments center on abstractive summarization, but the framework is general and broadly applicable. Use of the procedure produced significantly better results than likelihood maximization when comparing raw predictions. For the specific data tested, the gap could be bridged by employing post-processing of the maximum likelihood outputs. Nonetheless, the framework offers a new avenue for model optimization in situations where post-processing may be less straightforward or effective, and it can be extended to include more complex classes of undesirable outputs to penalize and train against, such as hallucinations.

چکیده به فارسی (ترجمه ماشینی)

یادگیری تقویت کننده برای تراز کردن مدل های زبان با سیگنال های اولویت انسانی پس از اولین بار در مدل برای پیش بینی نشانه بعدی متن در یک قسمت بزرگ با استفاده از حداکثر رساندن احتمال استفاده می شود.قبل از استقرار در یک دامنه خاص ، مدل ها اغلب بر روی داده های خاص کار تنظیم می شوند.از آنجا که ترجیحات انسانی اغلب برای آخرین مرحله در دسترس نیست ، با استفاده از حداکثر رساندن احتمال انجام می شود زیرا این روش پیش فرض معمولی است.با این حال ، یادگیری تقویت علاوه بر تسهیل تراز با عملکرد پاداش مشتق شده انسان ، مزایای دیگری دارد.برای یک ، در حالی که حداکثر رساندن احتمال نوعی یادگیری تقلید است که در آن مدل در مورد آنچه در شرایط ایده آل انجام می شود آموزش داده می شود ، یادگیری تقویت محدود به نشان دادن اقدامات فقط برای حالتهای بهینه رسیده نیست و یک مدل را آموزش می دهدسناریوها همانطور که به بررسی فضای سیاست می پردازد.علاوه بر این ، همچنین یک مدل را آموزش می دهد که چه کاری باید انجام دهد ، و اقدامات رقابتی اما ضعیف را سرکوب می کند.این کار چارچوبی را برای تنظیم دقیق مایل با استفاده از یادگیری تقویت کننده ایجاد می کند و آزمایش می کند که آیا این سود را بدست می آورد یا خیر.این آزمایشات در جمع بندی انتزاعی است ، اما این چارچوب به طور کلی و کاملاً کاربردی است.استفاده از این روش نتایج قابل توجهی بهتر از حداکثر احتمال در هنگام مقایسه پیش بینی های خام به دست آورد.برای داده های خاص آزمایش شده ، با استفاده از پردازش پس از فرآیند حداکثر احتمال ، می توان شکاف را برطرف کرد.با این وجود ، این چارچوب راه جدیدی را برای بهینه سازی مدل در شرایطی که ممکن است پس از پردازش ممکن است ساده تر یا مؤثر باشد ، ارائه می دهد و می تواند شامل کلاس های پیچیده تری از خروجی های نامطلوب برای مجازات و آموزش در برابر آن باشد ، مانند توهم.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.