ترجمه فارسی مقاله نمونه برداری از پنجره کشویی تامپسون برای تنظیمات غیر ثابت

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Sliding-Window Thompson Sampling for Non-Stationary Settings
عنوان مقاله به فارسی نمونه برداری از پنجره کشویی تامپسون برای تنظیمات غیر ثابت
نویسندگان Marco Fiandri, Alberto Maria Metelli, Francesco Trovò
فرمت مقاله انگلیسی PDF
تعداد صفحات 25
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Machine Learning,یادگیری ماشین , یادگیری ماشین ,
توضیحات Submitted 12 September, 2024; v1 submitted 8 September, 2024; originally announced September 2024. , Comments: 8 pages, 4 figures
توضیحات به فارسی ارسال شده 12 سپتامبر 2024 ؛V1 ارسال شده در 8 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد ، نظرات: 8 صفحه ، 4 شکل
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

$\textit{Restless Bandits}$ describe sequential decision-making problems in which the rewards evolve with time independently from the actions taken by the policy-maker. It has been shown that classical Bandit algorithms fail when the underlying environment is changing, making clear that in order to tackle more challenging scenarios specifically crafted algorithms are needed. In this paper, extending and correcting the work by \cite{trovo2020sliding}, we analyze two Thompson-Sampling inspired algorithms, namely $\texttt{BETA-SWTS}$ and $\texttt{$γ$-SWGTS}$, introduced to face the additional complexity given by the non-stationary nature of the settings; in particular we derive a general formulation for the regret in $\textit{any}$ arbitrary restless environment for both Bernoulli and Subgaussian rewards, and, through the introduction of new quantities, we delve in what contribution lays the deeper foundations of the error made by the algorithms. Finally, we infer from the general formulation the regret for two of the most common non-stationary settings: the $\textit{Abruptly Changing}$ and the $\textit{Smoothly Changing}$ environments.

چکیده به فارسی (ترجمه ماشینی)

$ \ textit {راهزنان بی قرار} $ مشکلات تصمیم گیری پی در پی را توصیف می کند که در آن پاداش ها با گذشت زمان به طور مستقل از اقدامات انجام شده توسط سیاست گذار تکامل می یابد.نشان داده شده است که الگوریتم های راهزن کلاسیک هنگام تغییر محیط زیربنایی شکست می خورند ، و روشن می کند که برای مقابله با سناریوهای چالش برانگیز تر به الگوریتم های خاص ساخته شده نیاز است.در این مقاله ، گسترش و تصحیح کار توسط \ cite {trovo2020sliding} ، ما دو الگوریتم الهام گرفته از تامپسون را تجزیه و تحلیل می کنیم ، یعنی $ \ texttt {beta-swts} $ و $ \ $ {γ $ -swgts}} $ ، معرفی شدهبا پیچیدگی اضافی که توسط ماهیت غیر ثابت تنظیمات داده می شود ، روبرو شوید.به طور خاص ، ما یک فرمول کلی برای پشیمانی در $ \ textit {هر محیط بی قرار خودسرانه $ $ برای هر دو پاداش برنولی و زیرگوشی به دست می آوریم ، و از طریق معرفی مقادیر جدید ، ما می دانیم که چه مشارکت در پایه های عمیق تر خطای ایجاد شده استتوسط الگوریتم ها.سرانجام ، ما از فرمولاسیون کلی پشیمانی برای دو مورد از رایج ترین تنظیمات غیر ثابت استنباط می کنیم: $ \ textit {به طور ناگهانی در حال تغییر} $ و $ \ textit {به آرامی در حال تغییر} $ است.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.