ترجمه فارسی مقاله بدون تأسف: بررسی و بهبود تقریب های پشیمانی برای کشف برنامه درسی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی No Regrets: Investigating and Improving Regret Approximations for Curriculum Discovery
عنوان مقاله به فارسی بدون تأسف: بررسی و بهبود تقریب های پشیمانی برای کشف برنامه درسی
نویسندگان Alexander Rutherford, Michael Beukman, Timon Willi, Bruno Lacerda, Nick Hawes, Jakob Foerster
فرمت مقاله انگلیسی PDF
تعداد صفحات 29
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,Robotics,یادگیری ماشین , هوش مصنوعی , روباتیک ,
توضیحات Submitted 29 August, 2024; v1 submitted 27 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده 29 اوت 2024 ؛V1 ارسال شده 27 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

What data or environments to use for training to improve downstream performance is a longstanding and very topical question in reinforcement learning. In particular, Unsupervised Environment Design (UED) methods have gained recent attention as their adaptive curricula enable agents to be robust to in- and out-of-distribution tasks. We ask to what extent these methods are themselves robust when applied to a novel setting, closely inspired by a real-world robotics problem. Surprisingly, we find that the state-of-the-art UED methods either do not improve upon the naïve baseline of Domain Randomisation (DR), or require substantial hyperparameter tuning to do so. Our analysis shows that this is due to their underlying scoring functions failing to predict intuitive measures of ``learnability'', i.e., in finding the settings that the agent sometimes solves, but not always. Based on this, we instead directly train on levels with high learnability and find that this simple and intuitive approach outperforms UED methods and DR in several binary-outcome environments, including on our domain and the standard UED domain of Minigrid. We further introduce a new adversarial evaluation procedure for directly measuring robustness, closely mirroring the conditional value at risk (CVaR). We open-source all our code and present visualisations of final policies here: https://github.com/amacrutherford/sampling-for-learnability.

چکیده به فارسی (ترجمه ماشینی)

آنچه داده ها یا محیط هایی که برای آموزش برای بهبود عملکرد پایین دست استفاده می کنند ، یک سؤال دیرینه و بسیار موضعی در یادگیری تقویت است.به طور خاص ، روش های طراحی محیط بدون نظارت (UED) توجه اخیر را به خود جلب کرده است زیرا برنامه های درسی تطبیقی ​​آنها باعث می شود عوامل را قادر به انجام کارهای درون و خارج از توزیع کنند.ما می پرسیم که این روشها در هنگام استفاده از یک تنظیم جدید ، از نزدیک با الهام از یک مشکل روباتیک در دنیای واقعی ، خودشان قوی هستند.با کمال تعجب ، ما می دانیم که روشهای پیشرفته UED یا بر اساس پایه ساده لوازم جانبی تصادفی دامنه (DR) بهبود نمی یابد ، یا برای انجام این کار نیاز به تنظیم بیش از حد پارارامتر دارد.تجزیه و تحلیل ما نشان می دهد که این به دلیل عملکردهای ثبات اساسی آنها در پیش بینی اقدامات شهودی "یادگیری" ، یعنی در یافتن تنظیماتی است که عامل گاهی حل می کند ، اما نه همیشه.بر این اساس ، ما در عوض به طور مستقیم در سطحی با یادگیری زیاد تمرین می کنیم و می دانیم که این رویکرد ساده و شهودی از روشهای UED و DR در چندین محیط با دوتایی ، از جمله در دامنه ما و دامنه استاندارد UED Minigrid استفاده می کند.ما در ادامه یک روش ارزیابی مخالف جدید برای اندازه گیری مستقیم استحکام ، از نزدیک آینه ای از ارزش مشروط در معرض خطر (CVAR) را معرفی می کنیم.ما تمام کد های خود را باز می کنیم و تصویری از سیاست های نهایی را در اینجا ارائه می دهیم: https://github.com/amacrutherford/sampling-for--learnability.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.