ترجمه فارسی مقاله یادگیری خط مشی آفلاین از طریق انتزاع مرحله مهارت برای وظایف مشروط با هدف افق بلند

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

عنوان مقاله به انگلیسی Offline Policy Learning via Skill-step Abstraction for Long-horizon Goal-Conditioned Tasks
عنوان مقاله به فارسی یادگیری خط مشی آفلاین از طریق انتزاع مرحله مهارت برای وظایف مشروط با هدف افق بلند
نویسندگان Donghoon Kim, Minjong Yoo, Honguk Woo
فرمت مقاله انگلیسی PDF
تعداد صفحات 9
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,یادگیری ماشین , هوش مصنوعی ,
توضیحات Submitted 20 August, 2024; originally announced August 2024. , Comments: 9 pages, 4 figures, International Joint Conference on Artificial Intelligence 2024, Published version
توضیحات به فارسی 20 اوت 2024 ارسال شد.در ابتدا اوت 2024 اعلام شد. ، نظرات: 9 صفحه ، 4 رقم ، کنفرانس مشترک بین المللی اطلاعات مصنوعی 2024 ، نسخه منتشر شده
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Goal-conditioned (GC) policy learning often faces a challenge arising from the sparsity of rewards, when confronting long-horizon goals. To address the challenge, we explore skill-based GC policy learning in offline settings, where skills are acquired from existing data and long-horizon goals are decomposed into sequences of near-term goals that align with these skills. Specifically, we present an `offline GC policy learning via skill-step abstraction' framework (GLvSA) tailored for tackling long-horizon GC tasks affected by goal distribution shifts. In the framework, a GC policy is progressively learned offline in conjunction with the incremental modeling of skill-step abstractions on the data. We also devise a GC policy hierarchy that not only accelerates GC policy learning within the framework but also allows for parameter-efficient fine-tuning of the policy. Through experiments with the maze and Franka kitchen environments, we demonstrate the superiority and efficiency of our GLvSA framework in adapting GC policies to a wide range of long-horizon goals. The framework achieves competitive zero-shot and few-shot adaptation performance, outperforming existing GC policy learning and skill-based methods.

چکیده به فارسی (ترجمه ماشینی)

یادگیری سیاست با هدف (GC) اغلب هنگام مقابله با اهداف افکار طولانی ، با چالش ناشی از کمبود پاداش ها روبرو می شود.برای پرداختن به این چالش ، ما یادگیری سیاست GC مبتنی بر مهارت را در تنظیمات آفلاین بررسی می کنیم ، جایی که مهارت ها از داده های موجود به دست می آیند و اهداف افکار طولانی به توالی اهداف نزدیک مدت که با این مهارت ها هماهنگ هستند تجزیه می شوند.به طور خاص ، ما یک یادگیری سیاست GC آفلاین از طریق چارچوب انتزاع مهارت (GLVSA) متناسب برای مقابله با وظایف GC طولانی هربورزون که تحت تأثیر تغییرات توزیع هدف قرار دارد ، ارائه می دهیم.در این چارچوب ، یک سیاست GC به تدریج در رابطه با مدل سازی افزایشی انتزاع های مرحله ای در داده ها به صورت آفلاین آموخته می شود.ما همچنین یک سلسله مراتب سیاست GC را ابداع می کنیم که نه تنها یادگیری سیاست GC را در چارچوب تسریع می کند بلکه امکان تنظیم دقیق پارامترها را نیز فراهم می کند.از طریق آزمایشات با محیط های پیچ و خم و فرانکا ، ما برتری و کارآیی چارچوب GLVSA خود را در تطبیق سیاست های GC با طیف گسترده ای از اهداف افکار طولانی نشان می دهیم.این چارچوب به عملکرد صفر و عملکرد تطبیقی ​​چند شات دست می یابد ، و از روشهای موجود در زمینه یادگیری سیاست GC و روشهای مبتنی بر مهارت استفاده می کند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.