ترجمه فارسی مقاله ارزیابی و یادگیری مؤثر خارج از سیاست در راهزنان ترکیبی متنی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

عنوان مقاله به انگلیسی Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits
عنوان مقاله به فارسی ارزیابی و یادگیری مؤثر خارج از سیاست در راهزنان ترکیبی متنی
نویسندگان Tatsuhiro Shimizu, Koichi Tanaka, Ren Kishimoto, Haruka Kiyohara, Masahiro Nomura, Yuta Saito
فرمت مقاله انگلیسی PDF
تعداد صفحات 28
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,Machine Learning,یادگیری ماشین , هوش مصنوعی , یادگیری ماشین ,
توضیحات Submitted 20 August, 2024; originally announced August 2024. , Comments: accepted at RecSys2024
توضیحات به فارسی 20 اوت 2024 ارسال شد.در ابتدا اوت 2024 اعلام شد. ، نظرات: پذیرفته شده در recsys2024
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

We explore off-policy evaluation and learning (OPE/L) in contextual combinatorial bandits (CCB), where a policy selects a subset in the action space. For example, it might choose a set of furniture pieces (a bed and a drawer) from available items (bed, drawer, chair, etc.) for interior design sales. This setting is widespread in fields such as recommender systems and healthcare, yet OPE/L of CCB remains unexplored in the relevant literature. Typical OPE/L methods such as regression and importance sampling can be applied to the CCB problem, however, they face significant challenges due to high bias or variance, exacerbated by the exponential growth in the number of available subsets. To address these challenges, we introduce a concept of factored action space, which allows us to decompose each subset into binary indicators. This formulation allows us to distinguish between the ''main effect'' derived from the main actions, and the ''residual effect'', originating from the supplemental actions, facilitating more effective OPE. Specifically, our estimator, called OPCB, leverages an importance sampling-based approach to unbiasedly estimate the main effect, while employing regression-based approach to deal with the residual effect with low variance. OPCB achieves substantial variance reduction compared to conventional importance sampling methods and bias reduction relative to regression methods under certain conditions, as illustrated in our theoretical analysis. Experiments demonstrate OPCB's superior performance over typical methods in both OPE and OPL.

چکیده به فارسی (ترجمه ماشینی)

ما ارزیابی و یادگیری خارج از سیاست (OPE/L) را در راهزنان ترکیبی متنی (CCB) بررسی می کنیم ، جایی که یک خط مشی زیر مجموعه ای را در فضای عمل انتخاب می کند.به عنوان مثال ، ممکن است مجموعه ای از قطعات مبلمان (یک تختخواب و کشو) را از وسایل موجود (تختخواب ، کشو ، صندلی و غیره) برای فروش طراحی داخلی انتخاب کند.این تنظیم در زمینه هایی مانند سیستم های پیشنهادی و مراقبت های بهداشتی گسترده است ، اما OPE/L CCB در ادبیات مربوطه ناشناخته است.روشهای معمولی OPE/L مانند رگرسیون و نمونه برداری از اهمیت می تواند برای مشکل CCB اعمال شود ، با این حال ، آنها به دلیل تعصب یا واریانس زیاد ، با چالش های قابل توجهی روبرو هستند که با رشد نمایی در تعداد زیر مجموعه های موجود تشدید می شود.برای پرداختن به این چالش ها ، ما مفهومی از فضای عمل Factored را معرفی می کنیم ، که به ما امکان می دهد هر زیر مجموعه را به شاخص های باینری تجزیه کنیم.این فرمولاسیون به ما امکان می دهد بین "اثر اصلی" حاصل از اقدامات اصلی و "اثر باقیمانده" ، که ناشی از اقدامات تکمیلی است ، تمایز قائل شویم و OPE مؤثرتر را تسهیل می کنیم.به طور خاص ، برآوردگر ما ، به نام OPCB ، از یک رویکرد مبتنی بر نمونه گیری اهمیت برای تخمین بی طرفانه اثر اصلی استفاده می کند ، در حالی که از رویکرد مبتنی بر رگرسیون برای مقابله با اثر باقیمانده با واریانس کم استفاده می کند.OPCB در مقایسه با روشهای نمونه گیری اهمیت معمولی و کاهش تعصب نسبت به روشهای رگرسیون در شرایط خاص ، کاهش قابل توجهی را به دست می آورد ، همانطور که در تجزیه و تحلیل نظری ما نشان داده شده است.آزمایشات عملکرد برتر OPCB را نسبت به روشهای معمولی در OPE و OPL نشان می دهد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.