ترجمه فارسی مقاله آموزش آفلاین قابل انتقال فرآیندهای تصمیم گیری منظم

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Tractable Offline Learning of Regular Decision Processes
عنوان مقاله به فارسی آموزش آفلاین قابل انتقال فرآیندهای تصمیم گیری منظم
نویسندگان Ahana Deb, Roberto Cipollone, Anders Jonsson, Alessandro Ronca, Mohammad Sadegh Talebi
فرمت مقاله انگلیسی PDF
تعداد صفحات 19
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,Formal Languages and Automata Theory,یادگیری ماشین , هوش مصنوعی , زبانهای رسمی و نظریه اتوماتیک ,
توضیحات Submitted 4 September, 2024; originally announced September 2024. , Comments: To appear in EWRL 2024
توضیحات به فارسی ارسال شده در 4 سپتامبر 2024 ؛در ابتدا در سپتامبر 2024 اعلام شد. ، نظرات: برای حضور در EWRL 2024
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

This work studies offline Reinforcement Learning (RL) in a class of non-Markovian environments called Regular Decision Processes (RDPs). In RDPs, the unknown dependency of future observations and rewards from the past interactions can be captured by some hidden finite-state automaton. For this reason, many RDP algorithms first reconstruct this unknown dependency using automata learning techniques. In this paper, we show that it is possible to overcome two strong limitations of previous offline RL algorithms for RDPs, notably RegORL. This can be accomplished via the introduction of two original techniques: the development of a new pseudometric based on formal languages, which removes a problematic dependency on $L_\infty^\mathsf{p}$-distinguishability parameters, and the adoption of Count-Min-Sketch (CMS), instead of naive counting. The former reduces the number of samples required in environments that are characterized by a low complexity in language-theoretic terms. The latter alleviates the memory requirements for long planning horizons. We derive the PAC sample complexity bounds associated to each of these techniques, and we validate the approach experimentally.

چکیده به فارسی (ترجمه ماشینی)

این کار به طور آفلاین یادگیری تقویت کننده (RL) در یک کلاس از محیط های غیر مارکووو به نام فرآیندهای تصمیم گیری منظم (RDP) بررسی می شود.در RDP ها ، وابستگی ناشناخته به مشاهدات و پاداش های آینده از تعامل گذشته می تواند توسط برخی از اتومات های پنهان حالت محدود ضبط شود.به همین دلیل ، بسیاری از الگوریتم های RDP ابتدا این وابستگی ناشناخته را با استفاده از تکنیک های یادگیری اتوماتیک بازسازی می کنند.در این مقاله ، ما نشان می دهیم که می توان بر دو محدودیت قوی الگوریتم های RL آفلاین قبلی برای RDP ها ، به ویژه Regorl غلبه کرد.این امر می تواند از طریق معرفی دو تکنیک اصلی انجام شود: توسعه یک شبهومتریک جدید بر اساس زبانهای رسمی ، که وابستگی مشکل ساز به $ l_ \ infty^\ mathsf {p} $ را از بین می برد-پارامترهای تشخیصی ، و پذیرش شمارشMin-Sketch (CMS) ، به جای شمارش ساده لوح.اولی تعداد نمونه های مورد نیاز در محیط هایی را که با پیچیدگی کم در اصطلاحات نظری زبان مشخص می شوند ، کاهش می دهد.دومی نیازهای حافظه را برای افق های برنامه ریزی طولانی کاهش می دهد.ما مرزهای پیچیدگی نمونه PAC مرتبط با هر یک از این تکنیک ها را استخراج می کنیم و رویکرد را به صورت تجربی تأیید می کنیم.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.