ترجمه فارسی مقاله بهینه سازی اولویت انتخابی از طریق تخمین تابع پاداش در سطح توکن

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Selective Preference Optimization via Token-Level Reward Function Estimation
عنوان مقاله به فارسی بهینه سازی اولویت انتخابی از طریق تخمین تابع پاداش در سطح توکن
نویسندگان Kailai Yang, Zhiwei Liu, Qianqian Xie, Jimin Huang, Erxue Min, Sophia Ananiadou
فرمت مقاله انگلیسی PDF
تعداد صفحات 15
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computation and Language,Artificial Intelligence,Machine Learning,محاسبه و زبان , هوش مصنوعی , یادگیری ماشین ,
توضیحات Submitted 24 August, 2024; originally announced August 2024. , Comments: Work in progress
توضیحات به فارسی ارسال شده در 24 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد. ، نظرات: کار در حال انجام
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Recent advancements in large language model alignment leverage token-level supervisions to perform fine-grained preference optimization. However, existing token-level alignment methods either optimize on all available tokens, which can be noisy and inefficient, or perform selective training with complex and expensive key token selection strategies. In this work, we propose Selective Preference Optimization (SePO), a novel selective alignment strategy that centers on efficient key token selection. SePO proposes the first token selection method based on Direct Preference Optimization (DPO), which trains an oracle model to estimate a token-level reward function on the target data. This method applies to any existing alignment datasets with response-level annotations and enables cost-efficient token selection with small-scale oracle models and training data. The estimated reward function is then utilized to score all tokens within the target dataset, where only the key tokens are selected to supervise the target policy model with a reference model-free contrastive objective function. Extensive experiments on three public evaluation benchmarks show that SePO significantly outperforms competitive baseline methods by only optimizing 30% key tokens on the target dataset. SePO applications on weak-to-strong generalization show that weak oracle models effectively supervise strong policy models with up to 16.8x more parameters. SePO also effectively selects key tokens from out-of-distribution data to enhance strong policy models and alleviate the over-optimization problem.

چکیده به فارسی (ترجمه ماشینی)

پیشرفت های اخیر در مدل های بزرگ تراز کردن مدل های زبانی برای انجام بهینه سازی ترجیح دانه ریز.با این حال ، روشهای تراز موجود در سطح توکن یا در تمام نشانه های موجود بهینه می شوند ، که می تواند پر سر و صدا و ناکارآمد باشد ، یا آموزش های انتخابی را با استراتژی های انتخابی کلیدی پیچیده و گران قیمت انجام دهید.در این کار ، ما بهینه سازی ترجیح انتخابی (SEPO) ، یک استراتژی تراز انتخابی جدید را پیشنهاد می کنیم که بر انتخاب کارآمد کلید مهم است.SEPO اولین روش انتخاب توکن را بر اساس بهینه سازی اولویت مستقیم (DPO) پیشنهاد می کند ، که یک مدل اوراکل را برای تخمین عملکرد پاداش در سطح توکن در داده های هدف آموزش می دهد.این روش برای هر مجموعه داده تراز موجود با حاشیه نویسی در سطح پاسخ اعمال می شود و انتخاب توکن مقرون به صرفه را با مدل های اوراکل در مقیاس کوچک و داده های آموزش امکان پذیر می کند.سپس از تابع پاداش تخمین زده شده برای نمره دادن تمام نشانه های موجود در مجموعه داده های هدف استفاده می شود ، جایی که فقط نشانه های اصلی برای نظارت بر مدل سیاست هدف با یک عملکرد هدف متضاد بدون مدل مرجع انتخاب می شوند.آزمایش های گسترده در مورد سه معیار ارزیابی عمومی نشان می دهد که SEPO به طور قابل توجهی از روشهای پایه رقابتی تنها با بهینه سازی 30 ٪ نشانه های کلید در مجموعه داده های هدف استفاده می کند.برنامه های SEPO در تعمیم ضعیف به تقویت نشان می دهد که مدل های ضعیف اوراکل به طور موثری بر مدلهای سیاست قوی با حداکثر پارامترهای 16.8 برابر بیشتر نظارت دارند.SEPO همچنین به طور موثری نشانه های کلیدی را از داده های خارج از توزیع برای افزایش مدلهای سیاست قوی و کاهش مشکل بهینه سازی بیش از حد انتخاب می کند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.