ترجمه فارسی مقاله تاخیر به عنوان پرداخت در MAB

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Delay as Payoff in MAB
عنوان مقاله به فارسی تاخیر به عنوان پرداخت در MAB
نویسندگان Ofir Schlisselberg, Ido Cohen, Tal Lancewicki, Yishay Mansour
فرمت مقاله انگلیسی PDF
تعداد صفحات 36
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,یادگیری ماشین ,
توضیحات Submitted 27 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده در 27 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

In this paper, we investigate a variant of the classical stochastic Multi-armed Bandit (MAB) problem, where the payoff received by an agent (either cost or reward) is both delayed, and directly corresponds to the magnitude of the delay. This setting models faithfully many real world scenarios such as the time it takes for a data packet to traverse a network given a choice of route (where delay serves as the agent's cost); or a user's time spent on a web page given a choice of content (where delay serves as the agent's reward). Our main contributions are tight upper and lower bounds for both the cost and reward settings. For the case that delays serve as costs, which we are the first to consider, we prove optimal regret that scales as $\sum_{i:Δ_i > 0}\frac{\log T}{Δ_i} + d^*$, where $T$ is the maximal number of steps, $Δ_i$ are the sub-optimality gaps and $d^*$ is the minimal expected delay amongst arms. For the case that delays serves as rewards, we show optimal regret of $\sum_{i:Δ_i > 0}\frac{\log T}{Δ_i} + \bar{d}$, where $\bar d$ is the second maximal expected delay. These improve over the regret in the general delay-dependent payoff setting, which scales as $\sum_{i:Δ_i > 0}\frac{\log T}{Δ_i} + D$, where $D$ is the maximum possible delay. Our regret bounds highlight the difference between the cost and reward scenarios, showing that the improvement in the cost scenario is more significant than for the reward. Finally, we accompany our theoretical results with an empirical evaluation.

چکیده به فارسی (ترجمه ماشینی)

در این مقاله ، ما یک نوع از مشکل راهزن چند مسلحانه تصادفی کلاسیک (MAB) را بررسی می کنیم ، جایی که بازپرداخت دریافت شده توسط یک عامل (یا هزینه یا پاداش) هر دو به تأخیر می افتد و مستقیماً با بزرگی تأخیر مطابقت دارد.این مدل ها با وفاداری بسیاری از سناریوهای دنیای واقعی مانند زمانی که برای یک بسته داده طول می کشد تا شبکه را با توجه به انتخاب مسیر (که در آن تأخیر به عنوان هزینه عامل عمل می کند) طی کند.یا زمان کاربر صرف شده در یک صفحه وب با توجه به انتخاب محتوا (که در آن تأخیر به عنوان پاداش نماینده عمل می کند).مشارکتهای اصلی ما برای تنظیمات هزینه و پاداش مرزهای بالا و پایین محکم است.برای موردی که تأخیر به عنوان هزینه ها انجام می شود ، که ما اولین بار در نظر داریم ، پشیمان می شویم که مقیاس به عنوان $ \ sum_ {i: Δ_i> 0} \ frac {\ log t} {Δ_i} + d^*$ ،در جایی که $ t $ حداکثر تعداد مراحل است ، $ Δ_i $ شکاف های زیر مطلوب و $ d^*$ حداقل تأخیر مورد انتظار در بین اسلحه است.برای موردی که تأخیر به عنوان پاداش دارد ، ما پشیمانی بهینه از $ \ sum_ {i: Δ_i> 0} \ frac {\ log t} {Δ_i} + \ bar {d} $ را نشان می دهیم ، جایی که $ \ bar d $ استتاخیر حداکثر حداکثر مورد انتظار.اینها بیش از حسرت در تنظیم عمومی بازپرداخت وابسته به تأخیر بهبود می یابند ، که به عنوان $ \ sum_ {i: Δ_i> 0} \ frac {\ log t} {Δ_i} + d $ ، جایی که $ d $ حداکثر تأخیر ممکن استبشرمرزهای پشیمانی ما تفاوت بین سناریوهای هزینه و پاداش را نشان می دهد ، نشان می دهد که بهبود سناریوی هزینه از پاداش مهمتر است.سرانجام ، ما نتایج نظری خود را با یک ارزیابی تجربی همراه می کنیم.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.