ترجمه فارسی مقاله راهزنان دوئل مغرضانه با بازخورد تاخیری تصادفی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Biased Dueling Bandits with Stochastic Delayed Feedback
عنوان مقاله به فارسی راهزنان دوئل مغرضانه با بازخورد تاخیری تصادفی
نویسندگان Bongsoo Yi, Yue Kang, Yao Li
فرمت مقاله انگلیسی PDF
تعداد صفحات 28
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Machine Learning,یادگیری ماشین , یادگیری ماشین ,
توضیحات Submitted 26 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده در 26 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

The dueling bandit problem, an essential variation of the traditional multi-armed bandit problem, has become significantly prominent recently due to its broad applications in online advertising, recommendation systems, information retrieval, and more. However, in many real-world applications, the feedback for actions is often subject to unavoidable delays and is not immediately available to the agent. This partially observable issue poses a significant challenge to existing dueling bandit literature, as it significantly affects how quickly and accurately the agent can update their policy on the fly. In this paper, we introduce and examine the biased dueling bandit problem with stochastic delayed feedback, revealing that this new practical problem will delve into a more realistic and intriguing scenario involving a preference bias between the selections. We present two algorithms designed to handle situations involving delay. Our first algorithm, requiring complete delay distribution information, achieves the optimal regret bound for the dueling bandit problem when there is no delay. The second algorithm is tailored for situations where the distribution is unknown, but only the expected value of delay is available. We provide a comprehensive regret analysis for the two proposed algorithms and then evaluate their empirical performance on both synthetic and real datasets.

چکیده به فارسی (ترجمه ماشینی)

مشکل راهزن دوئل ، یک تغییر اساسی در مسئله راهزن چند مسلح سنتی ، اخیراً به دلیل کاربردهای گسترده خود در تبلیغات آنلاین ، سیستم های توصیه ، بازیابی اطلاعات و موارد دیگر به طور قابل توجهی برجسته شده است.با این حال ، در بسیاری از برنامه های دنیای واقعی ، بازخورد اقدامات اغلب در معرض تأخیرهای غیرقابل اجتناب است و بلافاصله در دسترس نماینده نیست.این موضوع تا حدی قابل مشاهده ، چالش مهمی را برای ادبیات راهزن دوئل موجود ایجاد می کند ، زیرا این امر به طور چشمگیری تأثیر می گذارد که عامل می تواند سیاست خود را در پرواز به روز کند.در این مقاله ، ما مسئله راهزن دوئل مغرضانه را با بازخورد تأخیر تصادفی معرفی و بررسی می کنیم ، و نشان می دهیم که این مشکل عملی جدید به یک سناریوی واقع بینانه تر و جذاب تر مربوط می شود که شامل یک تعصب اولویت بین انتخاب ها است.ما دو الگوریتم را ارائه می دهیم که برای رسیدگی به موقعیت های مربوط به تأخیر طراحی شده است.اولین الگوریتم ما ، که نیاز به اطلاعات کامل توزیع تأخیر دارد ، در صورت عدم تأخیر ، پشیمانی بهینه برای مشکل راهزن دوئل را به دست می آورد.الگوریتم دوم برای موقعیت هایی که توزیع ناشناخته است تنظیم شده است ، اما فقط مقدار مورد انتظار تأخیر در دسترس است.ما یک تجزیه و تحلیل پشیمانی جامع برای دو الگوریتم پیشنهادی ارائه می دهیم و سپس عملکرد تجربی آنها را در هر دو مجموعه داده مصنوعی و واقعی ارزیابی می کنیم.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.