ترجمه فارسی مقاله یادگیری تقویتی کارآمد نمونه و Oracle برای MDP با توابع ارزش خطی قابل تحقق

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Sample- and Oracle-Efficient Reinforcement Learning for MDPs with Linearly-Realizable Value Functions
عنوان مقاله به فارسی یادگیری تقویتی کارآمد نمونه و Oracle برای MDP با توابع ارزش خطی قابل تحقق
نویسندگان Zakaria Mhammedi
فرمت مقاله انگلیسی PDF
تعداد صفحات 71
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,یادگیری ماشین , هوش مصنوعی ,
توضیحات Submitted 7 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال 7 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Designing sample-efficient and computationally feasible reinforcement learning (RL) algorithms is particularly challenging in environments with large or infinite state and action spaces. In this paper, we advance this effort by presenting an efficient algorithm for Markov Decision Processes (MDPs) where the state-action value function of any policy is linear in a given feature map. This challenging setting can model environments with infinite states and actions, strictly generalizes classic linear MDPs, and currently lacks a computationally efficient algorithm under online access to the MDP. Specifically, we introduce a new RL algorithm that efficiently finds a near-optimal policy in this setting, using a number of episodes and calls to a cost-sensitive classification (CSC) oracle that are both polynomial in the problem parameters. Notably, our CSC oracle can be efficiently implemented when the feature dimension is constant, representing a clear improvement over state-of-the-art methods, which require solving non-convex problems with horizon-many variables and can incur computational costs that are \emph{exponential} in the horizon.

چکیده به فارسی (ترجمه ماشینی)

طراحی الگوریتم های یادگیری تقویت کننده کارآمد و محاسباتی (RL) به ویژه در محیط هایی با وضعیت بزرگ یا نامحدود و فضاهای عمل به ویژه چالش برانگیز است.در این مقاله ، ما این تلاش را با ارائه الگوریتم کارآمد برای فرآیندهای تصمیم گیری مارکوف (MDP) که در آن تابع ارزش دولت هر خط مشی در نقشه ویژگی مشخص خطی است ، پیش می بریم.این تنظیم چالش برانگیز می تواند محیط هایی را با حالت ها و اقدامات نامتناهی مدل کند ، به شدت MDP های خطی کلاسیک را تعمیم می دهد ، و در حال حاضر فاقد یک الگوریتم محاسباتی کارآمد تحت دسترسی آنلاین به MDP است.به طور خاص ، ما یک الگوریتم RL جدید را معرفی می کنیم که به طور مؤثر یک خط مشی تقریباً بهینه را در این تنظیم پیدا می کند ، با استفاده از تعدادی از قسمت ها و تماس ها به یک طبقه بندی طبقه بندی حساس به هزینه (CSC) که هر دو چند جمله ای در پارامترهای مشکل هستند.نکته قابل توجه ، Oracle CSC ما می تواند به طور موثری در هنگام ثابت بودن بعد ویژگی اجرا شود ، و نشان دهنده پیشرفت روشنی نسبت به روشهای پیشرفته است ، که نیاز به حل مشکلات غیر متمایز با متغیرهای افق و بسیاری دارد و می تواند هزینه های محاسباتی را متحمل شود که \ \تأکید {نمایی} در افق.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.