ترجمه فارسی مقاله تقلید زبان از طریق یادگیری تقویتی معکوس مقیاس پذیر

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Imitating Language via Scalable Inverse Reinforcement Learning
عنوان مقاله به فارسی تقلید زبان از طریق یادگیری تقویتی معکوس مقیاس پذیر
نویسندگان Markus Wulfmeier, Michael Bloesch, Nino Vieillard, Arun Ahuja, Jorg Bornschein, Sandy Huang, Artem Sokolov, Matt Barnes, Guillaume Desjardins, Alex Bewley, Sarah Maria Elisabeth Bechtle, Jost Tobias Springenberg, Nikola Momchev, Olivier Bachem, Matthieu Geist, Martin Riedmiller
فرمت مقاله انگلیسی PDF
تعداد صفحات 21
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,Computation and Language,Machine Learning,یادگیری ماشین , هوش مصنوعی , محاسبات و زبان , یادگیری ماشین ,
توضیحات Submitted 2 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده در 2 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

The majority of language model training builds on imitation learning. It covers pretraining, supervised fine-tuning, and affects the starting conditions for reinforcement learning from human feedback (RLHF). The simplicity and scalability of maximum likelihood estimation (MLE) for next token prediction led to its role as predominant paradigm. However, the broader field of imitation learning can more effectively utilize the sequential structure underlying autoregressive generation. We focus on investigating the inverse reinforcement learning (IRL) perspective to imitation, extracting rewards and directly optimizing sequences instead of individual token likelihoods and evaluate its benefits for fine-tuning large language models. We provide a new angle, reformulating inverse soft-Q-learning as a temporal difference regularized extension of MLE. This creates a principled connection between MLE and IRL and allows trading off added complexity with increased performance and diversity of generations in the supervised fine-tuning (SFT) setting. We find clear advantages for IRL-based imitation, in particular for retaining diversity while maximizing task performance, rendering IRL a strong alternative on fixed SFT datasets even without online data generation. Our analysis of IRL-extracted reward functions further indicates benefits for more robust reward functions via tighter integration of supervised and preference-based LLM post-training.

چکیده به فارسی (ترجمه ماشینی)

اکثر آموزش های مدل زبان بر یادگیری تقلید بنا شده است.این امر پیشگویی ، تنظیم دقیق را تحت پوشش قرار می دهد و بر شرایط شروع یادگیری تقویت از بازخورد انسان (RLHF) تأثیر می گذارد.سادگی و مقیاس پذیری برآورد حداکثر احتمال (MLE) برای پیش بینی نشانه بعدی منجر به نقش آن به عنوان الگوی غالب شد.با این حال ، زمینه وسیع تر یادگیری تقلید می تواند به طور مؤثرتر از ساختار پی در پی اساسی نسل خودکار استفاده کند.ما بر روی بررسی دیدگاه یادگیری معکوس (IRL) برای تقلید ، استخراج پاداش و بهینه سازی توالی به جای احتمال نشانه های فردی تمرکز می کنیم و فواید آن را برای تنظیم دقیق مدل های بزرگ زبان ارزیابی می کنیم.ما یک زاویه جدید را ارائه می دهیم ، و دوباره یادگیری-q را به عنوان یک تفاوت زمانی منظم از MLE تغییر می دهیم.این یک ارتباط اصولی بین MLE و IRL ایجاد می کند و اجازه می دهد تا با افزایش عملکرد و تنوع نسل ها در تنظیم تنظیم دقیق (SFT) ، پیچیدگی اضافه شده را انجام دهد.ما مزایای روشنی برای تقلید مبتنی بر IRL ، به ویژه برای حفظ تنوع ضمن به حداکثر رساندن عملکرد کار ، می یابیم ، IRL را به یک جایگزین قوی در مجموعه داده های SFT ثابت حتی بدون تولید داده آنلاین تبدیل می کنیم.تجزیه و تحلیل ما از توابع پاداش EXTRACTER IRL بیشتر نشان می دهد مزایایی برای توابع پاداش قوی تر از طریق ادغام محکم تر از LLM تحت نظارت و مبتنی بر ترجیح.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.