Submitted 10 July, 2024; originally announced July 2024. , Comments: Short Paper accepted to RLC 2024 Workshop on Training Agents with Foundation Models
توضیحات به فارسی
10 ژوئیه 2024 ارسال شد.در ابتدا ژوئیه 2024 اعلام شد ، نظرات: مقاله کوتاه پذیرفته شده در کارگاه RLC 2024 در مورد نمایندگان آموزش با مدل های بنیاد
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs
چکیده
Foundation models are a promising path toward general-purpose and user-friendly robots. The prevalent approach involves training a generalist policy that, like a reinforcement learning policy, uses observations to output actions. Although this approach has seen much success, several concerns arise when considering deployment and end-user interaction with these systems. In particular, the lack of modularity between tasks means that when model weights are updated (e.g., when a user provides feedback), the behavior in other, unrelated tasks may be affected. This can negatively impact the system's interpretability and usability. We present an alternative approach to the design of robot foundation models, Diffusion for Policy Parameters (DPP), which generates stand-alone, task-specific policies. Since these policies are detached from the foundation model, they are updated only when a user wants, either through feedback or personalization, allowing them to gain a high degree of familiarity with that policy. We demonstrate a proof-of-concept of DPP in simulation then discuss its limitations and the future of interpretable foundation models.
چکیده به فارسی (ترجمه ماشینی)
مدل های بنیاد یک مسیر امیدوارکننده به سمت روبات های عمومی و کاربر پسند است.رویکرد شایع شامل آموزش یک سیاست عمومی است که مانند یک سیاست یادگیری تقویت ، از مشاهدات برای اقدامات خروجی استفاده می کند.اگرچه این رویکرد موفقیت های زیادی را مشاهده کرده است ، اما در نظر گرفتن استقرار و تعامل کاربر نهایی با این سیستم ها ، نگرانی های مختلفی ایجاد می شود.به طور خاص ، عدم وجود مدولار بین کارها به این معنی است که وقتی وزن مدل به روز می شود (به عنوان مثال ، هنگامی که کاربر بازخورد را ارائه می دهد) ، رفتار در سایر کارهای نامربوط ممکن است تحت تأثیر قرار گیرد.این می تواند بر تفسیر و قابلیت استفاده سیستم تأثیر منفی بگذارد.ما یک روش جایگزین برای طراحی مدل های بنیاد ربات ، انتشار برای پارامترهای خط مشی (DPP) ارائه می دهیم ، که سیاست های مستقل و خاص کار را ایجاد می کند.از آنجا که این سیاستها از مدل بنیاد جدا شده اند ، آنها فقط هنگامی که کاربر بخواهد ، یا از طریق بازخورد یا شخصی سازی ، به روز می شود ، به آنها امکان می دهد درجه بالایی از آشنایی را با آن خط مشی کسب کنند.ما اثبات مفهوم DPP در شبیه سازی را نشان می دهیم و سپس در مورد محدودیت های آن و آینده مدل های بنیاد قابل تفسیر بحث می کنیم.
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs