کتاب الگوریتم‌های یادگیری تقویتی: Q-learning و SARSA

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 62,488 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی

📚 محتوای این محصول آموزشی (پکیج کامل)

💡 این محصول یک نسخهٔ کامل و جامع است

تمامی محتوای آموزشی این کتاب در قالب یک بسته‌ی کامل و یکپارچه ارائه می‌شود و شامل تمام نسخه‌ها و فایل‌های موردنیاز برای یادگیری است.

🎁 محتویات کامل بسته دانلودی

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل کتاب‌ها، تمرین‌ها و خودآزمایی .


ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود و نسخهٔ چاپی ندارد.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های کتاب همانجا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

🎓 دوره آموزشی جامع

📚 اطلاعات دوره

عنوان دوره: دوره الگوریتم‌های یادگیری تقویتی: Q-learning و SARSA

موضوع کلی: برنامه نویسی

موضوع میانی: الگوریتم‌ها و ساختمان داده‌ها

📋 سرفصل‌های دوره

  • 1. Q-learning: مفاهیم پایه و تعریف مسئله
  • 2. فرآیند تصمیم‌گیری مارکوف (MDP) در یادگیری تقویتی
  • 3. ساختار عامل و محیط در Q-learning
  • 4. جدول Q: مقداردهی اولیه و به‌روزرسانی
  • 5. معادله بلمن در Q-learning
  • 6. پارامتر نرخ یادگیری (Alpha) در Q-learning
  • 7. عامل تخفیف (Gamma) و تأثیر آن بر تصمیم‌گیری
  • 8. سیاست اپسیلون-حریصانه (Epsilon-Greedy) در اکتشاف و بهره‌برداری
  • 9. پیاده‌سازی گام به گام الگوریتم Q-learning
  • 10. حلقه آموزش در Q-learning: تکرار و همگرایی
  • 11. SARSA: تعریف و تفاوت با Q-learning
  • 12. معادله به‌روزرسانی در SARSA
  • 13. سیاست on-policy در SARSA
  • 14. مقایسه on-policy و off-policy در یادگیری تقویتی
  • 15. پیاده‌سازی گام به گام الگوریتم SARSA
  • 16. تأثیر پارامتر اپسیلون در SARSA
  • 17. مفهوم پاداش و تابع ارزش در Q-learning و SARSA
  • 18. مسئله پایداری و همگرایی در Q-learning
  • 19. مسئله پایداری و همگرایی در SARSA
  • 20. شبیه‌سازی محیط ساده (Gridworld) برای آموزش
  • 21. پیاده‌سازی Q-learning در محیط Gridworld
  • 22. پیاده‌سازی SARSA در محیط Gridworld
  • 23. مقایسه عملکرد Q-learning و SARSA در محیط‌های تصادفی
  • 24. مفهوم overestimation در Q-learning و راهکارهای کاهش آن
  • 25. معرفی Double Q-learning برای کاهش overestimation
  • 26. انتخاب پارامترهای بهینه (Alpha, Gamma, Epsilon)
  • 27. تکنیک‌های بهبود سرعت یادگیری در Q-learning
  • 28. مدیریت فضای حالت در مسائل با ابعاد بزرگ
  • 29. مفهوم تابع تقریب (Function Approximation) در Q-learning
  • 30. معرفی Q-learning با شبکه عصبی (Deep Q-Network)
  • 31. کاربرد Q-learning در مسائل مسیریابی ربات
  • 32. کاربرد SARSA در کنترل فرآیندهای صنعتی
  • 33. شبیه‌سازی محیط Cliff Walking و تحلیل نتایج
  • 34. تحلیل رفتار عامل در مقابل خطر (Risk) با SARSA و Q-learning
  • 35. تکنیک replay buffer برای پایداری در یادگیری عمیق
  • 36. راهکارهای جلوگیری از واگرایی در Q-learning
  • 37. پیاده‌سازی الگوریتم Expected SARSA
  • 38. مقایسه Expected SARSA با SARSA و Q-learning
  • 39. ارزیابی عملکرد با معیارهای پاداش تجمعی و خطا
  • 40. بهینه‌سازی حافظه و محاسبات در پیاده‌سازی جدول Q
  • 41. مدیریت محیط‌های غیرایستا (Non-stationary) در یادگیری تقویتی
  • 42. مفهوم eligibility traces در الگوریتم‌های SARSA
  • 43. معرفی الگوریتم SARSA(λ) و تفاوت آن با SARSA ساده
  • 44. پیاده‌سازی SARSA(λ) در محیط‌های گسسته
  • 45. تأثیر مقدار λ بر سرعت یادگیری در SARSA(λ)
  • 46. مقایسه Q-learning، SARSA و SARSA(λ) در محیط‌های مختلف
  • 47. تحلیل پیچیدگی زمانی و حافظه الگوریتم‌ها
  • 48. روش‌های انتخاب خودکار اپسیلون در طول آموزش
  • 49. چالش sparse reward در Q-learning و SARSA
  • 50. معرفی reward shaping برای بهبود یادگیری
  • 51. مدیریت حالت‌های پایانی (Terminal States) در محیط
  • 52. پیاده‌سازی سیستم پاداش دهی در مسائل عملی
  • 53. تست و اعتبارسنجی سیاست یادگرفته شده
  • 54. تکنیک‌های Debugging برای خطاهای رایج در پیاده‌سازی
  • 55. بهینه‌سازی کد برای اجرای سریع در پایتون
  • 56. مقایسه کتابخانه‌های موجود (مانند Gym) برای شبیه‌سازی
  • 57. پیاده‌سازی محیط سفارشی برای Q-learning و SARSA
  • 58. تحلیل نتایج با نمودارهای یادگیری (Learning Curves)
  • 59. مدیریت hyperparameter tuning برای بهترین عملکرد
  • 60. مطالعه موردی: بازی ساده (مانند FrozenLake) با Q-learning
  • 61. مطالعه موردی: بازی ساده (مانند FrozenLake) با SARSA
  • 62. مقایسه نهایی: انتخاب الگوریتم مناسب برای مسئله

📚 محتوای این محصول آموزشی (پکیج کامل)

💡 این محصول یک نسخهٔ کامل و جامع است

تمامی محتوای آموزشی این کتاب در قالب یک بسته‌ی کامل و یکپارچه ارائه می‌شود و شامل تمام نسخه‌ها و فایل‌های موردنیاز برای یادگیری است.

🎁 محتویات کامل بسته دانلودی

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل کتاب‌ها، تمرین‌ها و خودآزمایی .


ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود و نسخهٔ چاپی ندارد.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های کتاب همانجا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.