کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs
چکیده
In this paper, we investigate a variant of the classical stochastic Multi-armed Bandit (MAB) problem, where the payoff received by an agent (either cost or reward) is both delayed, and directly corresponds to the magnitude of the delay. This setting models faithfully many real world scenarios such as the time it takes for a data packet to traverse a network given a choice of route (where delay serves as the agent's cost); or a user's time spent on a web page given a choice of content (where delay serves as the agent's reward). Our main contributions are tight upper and lower bounds for both the cost and reward settings. For the case that delays serve as costs, which we are the first to consider, we prove optimal regret that scales as $\sum_{i:Δ_i > 0}\frac{\log T}{Δ_i} + d^*$, where $T$ is the maximal number of steps, $Δ_i$ are the sub-optimality gaps and $d^*$ is the minimal expected delay amongst arms. For the case that delays serves as rewards, we show optimal regret of $\sum_{i:Δ_i > 0}\frac{\log T}{Δ_i} + \bar{d}$, where $\bar d$ is the second maximal expected delay. These improve over the regret in the general delay-dependent payoff setting, which scales as $\sum_{i:Δ_i > 0}\frac{\log T}{Δ_i} + D$, where $D$ is the maximum possible delay. Our regret bounds highlight the difference between the cost and reward scenarios, showing that the improvement in the cost scenario is more significant than for the reward. Finally, we accompany our theoretical results with an empirical evaluation.
چکیده به فارسی (ترجمه ماشینی)
در این مقاله ، ما یک نوع از مشکل راهزن چند مسلحانه تصادفی کلاسیک (MAB) را بررسی می کنیم ، جایی که بازپرداخت دریافت شده توسط یک عامل (یا هزینه یا پاداش) هر دو به تأخیر می افتد و مستقیماً با بزرگی تأخیر مطابقت دارد.این مدل ها با وفاداری بسیاری از سناریوهای دنیای واقعی مانند زمانی که برای یک بسته داده طول می کشد تا شبکه را با توجه به انتخاب مسیر (که در آن تأخیر به عنوان هزینه عامل عمل می کند) طی کند.یا زمان کاربر صرف شده در یک صفحه وب با توجه به انتخاب محتوا (که در آن تأخیر به عنوان پاداش نماینده عمل می کند).مشارکتهای اصلی ما برای تنظیمات هزینه و پاداش مرزهای بالا و پایین محکم است.برای موردی که تأخیر به عنوان هزینه ها انجام می شود ، که ما اولین بار در نظر داریم ، پشیمان می شویم که مقیاس به عنوان $ \ sum_ {i: Δ_i> 0} \ frac {\ log t} {Δ_i} + d^*$ ،در جایی که $ t $ حداکثر تعداد مراحل است ، $ Δ_i $ شکاف های زیر مطلوب و $ d^*$ حداقل تأخیر مورد انتظار در بین اسلحه است.برای موردی که تأخیر به عنوان پاداش دارد ، ما پشیمانی بهینه از $ \ sum_ {i: Δ_i> 0} \ frac {\ log t} {Δ_i} + \ bar {d} $ را نشان می دهیم ، جایی که $ \ bar d $ استتاخیر حداکثر حداکثر مورد انتظار.اینها بیش از حسرت در تنظیم عمومی بازپرداخت وابسته به تأخیر بهبود می یابند ، که به عنوان $ \ sum_ {i: Δ_i> 0} \ frac {\ log t} {Δ_i} + d $ ، جایی که $ d $ حداکثر تأخیر ممکن استبشرمرزهای پشیمانی ما تفاوت بین سناریوهای هزینه و پاداش را نشان می دهد ، نشان می دهد که بهبود سناریوی هزینه از پاداش مهمتر است.سرانجام ، ما نتایج نظری خود را با یک ارزیابی تجربی همراه می کنیم.
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs