ترجمه فارسی مقاله خطای تفاضل زمانی گاوسی تعمیم‌یافته برای یادگیری تقویتی آگاه از عدم قطعیت

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Generalized Gaussian Temporal Difference Error For Uncertainty-aware Reinforcement Learning
عنوان مقاله به فارسی خطای تفاضل زمانی گاوسی تعمیم‌یافته برای یادگیری تقویتی آگاه از عدم قطعیت
نویسندگان Seyeon Kim, Joonhun Lee, Namhoon Cho, Sungjun Han, Seungeon Baek
فرمت مقاله انگلیسی PDF
تعداد صفحات 21
دسته بندی موضوعات Machine Learning,Artificial Intelligence,Probability,Machine Learning,یادگیری ماشین , هوش مصنوعی , احتمال , یادگیری ماشین ,
توضیحات Submitted 5 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده در 5 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.

قیمت: 19,000 تومان

سفارش

با انتخاب این گزینه، علاوه بر دریافت مقاله اصلی، را نیز سفارش می‌دهید.

قیمت: 840,000 تومان

زمان تحویل: 2 تا 3 روز کاری


📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Conventional uncertainty-aware temporal difference (TD) learning methods often rely on simplistic assumptions, typically including a zero-mean Gaussian distribution for TD errors. Such oversimplification can lead to inaccurate error representations and compromised uncertainty estimation. In this paper, we introduce a novel framework for generalized Gaussian error modeling in deep reinforcement learning, applicable to both discrete and continuous control settings. Our framework enhances the flexibility of error distribution modeling by incorporating higher-order moments, particularly kurtosis, thereby improving the estimation and mitigation of data-dependent noise, i.e., aleatoric uncertainty. We examine the influence of the shape parameter of the generalized Gaussian distribution (GGD) on aleatoric uncertainty and provide a closed-form expression that demonstrates an inverse relationship between uncertainty and the shape parameter. Additionally, we propose a theoretically grounded weighting scheme to fully leverage the GGD. To address epistemic uncertainty, we enhance the batch inverse variance weighting by incorporating bias reduction and kurtosis considerations, resulting in improved robustness. Extensive experimental evaluations using policy gradient algorithms demonstrate the consistent efficacy of our method, showcasing significant performance improvements.

چکیده به فارسی (ترجمه ماشینی)

روشهای یادگیری تفاوت زمانی عدم قطعیت متعارف (TD) اغلب به فرضیات ساده گرایانه متکی هستند ، به طور معمول شامل توزیع گاوسی صفر برای خطاهای TD.چنین توضیح بیش از حد می تواند منجر به بازنمایی خطای نادرست و برآورد عدم اطمینان شود.در این مقاله ، ما یک چارچوب جدید برای مدل سازی خطای عمومی گاوسی در یادگیری تقویت عمیق ، که برای هر دو تنظیم کنترل گسسته و مداوم کاربرد دارد ، معرفی می کنیم.چارچوب ما انعطاف پذیری مدل سازی توزیع خطا را با ترکیب لحظات مرتبه بالاتر ، به ویژه کورتوز افزایش می دهد ، در نتیجه تخمین و کاهش سر و صدای وابسته به داده ها ، یعنی عدم اطمینان آلوئوریک را بهبود می بخشد.ما تأثیر پارامتر شکل توزیع گاوسی تعمیم یافته (GGD) بر عدم اطمینان آلوئوریک را بررسی می کنیم و یک عبارت بسته را ارائه می دهیم که نشان دهنده یک رابطه معکوس بین عدم اطمینان و پارامتر شکل است.علاوه بر این ، ما یک طرح وزنه برداری از لحاظ نظری برای استفاده کامل از GGD پیشنهاد می کنیم.برای پرداختن به عدم اطمینان معرفتی ، ما با استفاده از ملاحظات کاهش تعصب و كورتوز ، وزن واریانس معکوس دسته ای را افزایش می دهیم و منجر به بهبود استحکام می شویم.ارزیابی های تجربی گسترده با استفاده از الگوریتم های شیب خط مشی ، اثربخشی مداوم روش ما را نشان می دهد ، و پیشرفت های قابل توجهی در عملکرد را نشان می دهد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.