ترجمه فارسی مقاله یادگیری خط مشی رسیدن به هدف از مشاهدات غیر متخصص از طریق راهنمایی مؤثر فرعی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Goal-Reaching Policy Learning from Non-Expert Observations via Effective Subgoal Guidance
عنوان مقاله به فارسی یادگیری خط مشی رسیدن به هدف از مشاهدات غیر متخصص از طریق راهنمایی مؤثر فرعی
نویسندگان RenMing Huang, Shaochong Liu, Yunqiang Pei, Peng Wang, Guoqing Wang, Yang Yang, Hengtao Shen
فرمت مقاله انگلیسی PDF
تعداد صفحات 19
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Robotics,یادگیری ماشین , روباتیک ,
توضیحات Submitted 5 September, 2024; originally announced September 2024. , Comments: Accepted to CoRL 2024
توضیحات به فارسی ارسال شده در 5 سپتامبر 2024 ؛در ابتدا در سپتامبر 2024 اعلام شد. ، نظرات: پذیرفته شده به Corl 2024
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

In this work, we address the challenging problem of long-horizon goal-reaching policy learning from non-expert, action-free observation data. Unlike fully labeled expert data, our data is more accessible and avoids the costly process of action labeling. Additionally, compared to online learning, which often involves aimless exploration, our data provides useful guidance for more efficient exploration. To achieve our goal, we propose a novel subgoal guidance learning strategy. The motivation behind this strategy is that long-horizon goals offer limited guidance for efficient exploration and accurate state transition. We develop a diffusion strategy-based high-level policy to generate reasonable subgoals as waypoints, preferring states that more easily lead to the final goal. Additionally, we learn state-goal value functions to encourage efficient subgoal reaching. These two components naturally integrate into the off-policy actor-critic framework, enabling efficient goal attainment through informative exploration. We evaluate our method on complex robotic navigation and manipulation tasks, demonstrating a significant performance advantage over existing methods. Our ablation study further shows that our method is robust to observation data with various corruptions.

چکیده به فارسی (ترجمه ماشینی)

در این کار ، ما به مشکل چالش برانگیز یادگیری سیاست های هدفمند در زمینه هدف از داده های مشاهده غیرقانونی و بدون عمل پرداخته ایم.بر خلاف داده های متخصص کاملاً دارای برچسب ، داده های ما در دسترس تر است و از روند پرهزینه برچسب زدن به عمل جلوگیری می کند.علاوه بر این ، در مقایسه با یادگیری آنلاین ، که اغلب شامل اکتشاف بی هدف است ، داده های ما راهنمایی مفیدی را برای اکتشاف کارآمدتر ارائه می دهد.برای رسیدن به هدف خود ، ما یک استراتژی جدید یادگیری راهنمایی زیرزمینی را پیشنهاد می کنیم.انگیزه این استراتژی این است که اهداف افکار طولانی مدت راهنمایی های محدودی را برای اکتشاف کارآمد و انتقال دقیق دولت ارائه می دهند.ما یک سیاست سطح بالا مبتنی بر پراکندگی را برای تولید زیرمجموعه های معقول به عنوان نقطه راه ایجاد می کنیم ، و ترجیح می دهیم که به راحتی منجر به هدف نهایی شود.علاوه بر این ، ما توابع ارزش دولت را برای تشویق دستیابی به زیرزمین کارآمد یاد می گیریم.این دو مؤلفه به طور طبیعی در چارچوب بازیگر نقدی-انتقادی ادغام می شوند و امکان دستیابی به هدف کارآمد را از طریق اکتشافات آموزنده فراهم می کنند.ما روش خود را در مورد کارهای پیچیده ناوبری و دستکاری روباتیک ارزیابی می کنیم و یک مزیت عملکرد قابل توجه نسبت به روشهای موجود را نشان می دهیم.مطالعه فرسایش ما بیشتر نشان می دهد که روش ما نسبت به مشاهده داده ها با فساد های مختلف قوی است.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.