ترجمه فارسی مقاله تقلید زبان از طریق یادگیری تقویتی معکوس مقیاس پذیر
عنوان مقاله به انگلیسی
Imitating Language via Scalable Inverse Reinforcement Learning
عنوان مقاله به فارسی
تقلید زبان از طریق یادگیری تقویتی معکوس مقیاس پذیر
نویسندگان
Markus Wulfmeier, Michael Bloesch, Nino Vieillard, Arun Ahuja, Jorg Bornschein, Sandy Huang, Artem Sokolov, Matt Barnes, Guillaume Desjardins, Alex Bewley, Sarah Maria Elisabeth Bechtle, Jost Tobias Springenberg, Nikola Momchev, Olivier Bachem, Matthieu Geist, Martin Riedmiller
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs
چکیده
The majority of language model training builds on imitation learning. It covers pretraining, supervised fine-tuning, and affects the starting conditions for reinforcement learning from human feedback (RLHF). The simplicity and scalability of maximum likelihood estimation (MLE) for next token prediction led to its role as predominant paradigm. However, the broader field of imitation learning can more effectively utilize the sequential structure underlying autoregressive generation. We focus on investigating the inverse reinforcement learning (IRL) perspective to imitation, extracting rewards and directly optimizing sequences instead of individual token likelihoods and evaluate its benefits for fine-tuning large language models. We provide a new angle, reformulating inverse soft-Q-learning as a temporal difference regularized extension of MLE. This creates a principled connection between MLE and IRL and allows trading off added complexity with increased performance and diversity of generations in the supervised fine-tuning (SFT) setting. We find clear advantages for IRL-based imitation, in particular for retaining diversity while maximizing task performance, rendering IRL a strong alternative on fixed SFT datasets even without online data generation. Our analysis of IRL-extracted reward functions further indicates benefits for more robust reward functions via tighter integration of supervised and preference-based LLM post-training.
چکیده به فارسی (ترجمه ماشینی)
اکثر آموزش های مدل زبان بر یادگیری تقلید بنا شده است.این امر پیشگویی ، تنظیم دقیق را تحت پوشش قرار می دهد و بر شرایط شروع یادگیری تقویت از بازخورد انسان (RLHF) تأثیر می گذارد.سادگی و مقیاس پذیری برآورد حداکثر احتمال (MLE) برای پیش بینی نشانه بعدی منجر به نقش آن به عنوان الگوی غالب شد.با این حال ، زمینه وسیع تر یادگیری تقلید می تواند به طور مؤثرتر از ساختار پی در پی اساسی نسل خودکار استفاده کند.ما بر روی بررسی دیدگاه یادگیری معکوس (IRL) برای تقلید ، استخراج پاداش و بهینه سازی توالی به جای احتمال نشانه های فردی تمرکز می کنیم و فواید آن را برای تنظیم دقیق مدل های بزرگ زبان ارزیابی می کنیم.ما یک زاویه جدید را ارائه می دهیم ، و دوباره یادگیری-q را به عنوان یک تفاوت زمانی منظم از MLE تغییر می دهیم.این یک ارتباط اصولی بین MLE و IRL ایجاد می کند و اجازه می دهد تا با افزایش عملکرد و تنوع نسل ها در تنظیم تنظیم دقیق (SFT) ، پیچیدگی اضافه شده را انجام دهد.ما مزایای روشنی برای تقلید مبتنی بر IRL ، به ویژه برای حفظ تنوع ضمن به حداکثر رساندن عملکرد کار ، می یابیم ، IRL را به یک جایگزین قوی در مجموعه داده های SFT ثابت حتی بدون تولید داده آنلاین تبدیل می کنیم.تجزیه و تحلیل ما از توابع پاداش EXTRACTER IRL بیشتر نشان می دهد مزایایی برای توابع پاداش قوی تر از طریق ادغام محکم تر از LLM تحت نظارت و مبتنی بر ترجیح.
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs