ترجمه فارسی مقاله یادگیری ماشین های پاداش قوی از Noisy Labels

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Learning Robust Reward Machines from Noisy Labels
عنوان مقاله به فارسی یادگیری ماشین های پاداش قوی از Noisy Labels
نویسندگان Roko Parac, Lorenzo Nodari, Leo Ardon, Daniel Furelos-Blanco, Federico Cerutti, Alessandra Russo
فرمت مقاله انگلیسی PDF
تعداد صفحات 11
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Artificial Intelligence,Machine Learning,هوش مصنوعی , یادگیری ماشین ,
توضیحات Submitted 27 August, 2024; originally announced August 2024. , Comments: Preprint accepted for publication to the 21st International Conference on Principles of Knowledge Representation and Reasoning (KR 2024)
توضیحات به فارسی ارسال شده در 27 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد. ، نظرات: Preprint پذیرفته شده برای انتشار به بیست و یکمین کنفرانس بین المللی اصول نمایندگی و استدلال (KR 2024)
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

This paper presents PROB-IRM, an approach that learns robust reward machines (RMs) for reinforcement learning (RL) agents from noisy execution traces. The key aspect of RM-driven RL is the exploitation of a finite-state machine that decomposes the agent's task into different subtasks. PROB-IRM uses a state-of-the-art inductive logic programming framework robust to noisy examples to learn RMs from noisy traces using the Bayesian posterior degree of beliefs, thus ensuring robustness against inconsistencies. Pivotal for the results is the interleaving between RM learning and policy learning: a new RM is learned whenever the RL agent generates a trace that is believed not to be accepted by the current RM. To speed up the training of the RL agent, PROB-IRM employs a probabilistic formulation of reward shaping that uses the posterior Bayesian beliefs derived from the traces. Our experimental analysis shows that PROB-IRM can learn (potentially imperfect) RMs from noisy traces and exploit them to train an RL agent to solve its tasks successfully. Despite the complexity of learning the RM from noisy traces, agents trained with PROB-IRM perform comparably to agents provided with handcrafted RMs.

چکیده به فارسی (ترجمه ماشینی)

این مقاله Prob-IRM را ارائه می دهد ، رویکردی که ماشین های پاداش قوی (RMS) را برای مأمورین یادگیری تقویت (RL) از اثری از اجرای پر سر و صدا می آموزد.جنبه اصلی RM محور RL بهره برداری از یک دستگاه با حالت محدود است که وظیفه عامل را به زیر مجموعه های مختلف تجزیه می کند.Prob-ERR از یک چارچوب پیشرفته منطق القایی پیشرفته برای نمونه های پر سر و صدا برای یادگیری RMS از آثار پر سر و صدا با استفاده از درجه اعتقادات خلفی بیزی استفاده می کند ، بنابراین از استحکام در برابر ناسازگاری ها اطمینان می دهد.محوری برای نتایج ، درهم آمیختن بین یادگیری RM و یادگیری سیاست است: RM جدید هر زمان که عامل RL اثری ایجاد کند که اعتقاد بر این است که توسط RM فعلی پذیرفته نشود ، آموخته می شود.برای سرعت بخشیدن به آموزش عامل RL ، Prob-ERM از فرمولاسیون احتمالی شکل گیری پاداش استفاده می کند که از اعتقادات بیزی خلفی حاصل از آثار استفاده می کند.تجزیه و تحلیل تجربی ما نشان می دهد که Prob-IRM می تواند RMS (به طور بالقوه ناقص) RMS را از آثار پر سر و صدا یاد بگیرد و از آنها برای آموزش یک عامل RL برای حل موفقیت آمیز وظایف خود استفاده کند.علیرغم پیچیدگی یادگیری RM از آثار پر سر و صدا ، عوامل آموزش دیده با Prob-IRM نسبتاً با عوامل ارائه شده با RMS دست ساز عمل می کنند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.