Machine Learning,Computer Science and Game Theory,یادگیری ماشین , علوم کامپیوتر و نظریه بازی ,
توضیحات
Submitted 4 September, 2024; v1 submitted 2 September, 2024; originally announced September 2024. , Comments: A preliminary version [arXiv:2303.03100] of this paper, with a subset of the results that are presented here, was presented at NeurIPS 2023
توضیحات به فارسی
ارسال شده در 4 سپتامبر 2024 ؛V1 ارسال شده در 2 سپتامبر 2024 ؛در ابتدا در سپتامبر 2024 اعلام شد ، نظرات: نسخه اولیه [ARXIV: 2303.03100] از این مقاله ، با زیر مجموعه ای از نتایج ارائه شده در اینجا ، در Neurips 2023 ارائه شده است
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs
چکیده
In this paper, we consider two-player zero-sum matrix and stochastic games and develop learning dynamics that are payoff-based, convergent, rational, and symmetric between the two players. Specifically, the learning dynamics for matrix games are based on the smoothed best-response dynamics, while the learning dynamics for stochastic games build upon those for matrix games, with additional incorporation of the minimax value iteration. To our knowledge, our theoretical results present the first finite-sample analysis of such learning dynamics with last-iterate guarantees. In the matrix game setting, the results imply a sample complexity of $O(ε^{-1})$ to find the Nash distribution and a sample complexity of $O(ε^{-8})$ to find a Nash equilibrium. In the stochastic game setting, the results also imply a sample complexity of $O(ε^{-8})$ to find a Nash equilibrium. To establish these results, the main challenge is to handle stochastic approximation algorithms with multiple sets of coupled and stochastic iterates that evolve on (possibly) different time scales. To overcome this challenge, we developed a coupled Lyapunov-based approach, which may be of independent interest to the broader community studying the convergence behavior of stochastic approximation algorithms.
چکیده به فارسی (ترجمه ماشینی)
در این مقاله ، ما ماتریس دو نفره صفر و بازی های تصادفی را در نظر می گیریم و پویایی یادگیری را توسعه می دهیم که مبتنی بر بازپرداخت ، همگرا ، منطقی و متقارن بین این دو بازیکن است.به طور خاص ، دینامیک یادگیری برای بازی های ماتریس مبتنی بر پویایی بهترین پاسخ است ، در حالی که دینامیک یادگیری برای بازی های تصادفی بر روی بازی های ماتریس ساخته شده است ، با ترکیب اضافی تکرار ارزش حداقل.به دانش ما ، نتایج نظری ما اولین تجزیه و تحلیل نمونه محدود از چنین پویایی یادگیری با ضمانت های سواد آخر را ارائه می دهد.در تنظیم بازی ماتریس ، نتایج حاکی از پیچیدگی نمونه $ O (ε^{-1}) $ برای یافتن توزیع NASH و پیچیدگی نمونه $ O (ε^{-8}) برای یافتن یک تعادل Nashبشردر تنظیم بازی تصادفی ، نتایج همچنین حاکی از پیچیدگی نمونه ای از $ O (ε^{-8}) $ برای یافتن تعادل NASH است.برای تعیین این نتایج ، چالش اصلی رسیدگی به الگوریتم های تقریبی تصادفی با مجموعه های متعدد تکرارهای همراه و تصادفی است که در مقیاس های زمانی مختلف (احتمالاً) تکامل می یابند.برای غلبه بر این چالش ، ما یک رویکرد مبتنی بر لیاپونوف را توسعه دادیم ، که ممکن است مورد توجه مستقل جامعه وسیع تری باشد که رفتار همگرایی الگوریتم های تقریبی تصادفی را مطالعه می کند.
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs