ترجمه فارسی مقاله قانون تعادل: استراتژی‌های اولویت‌بندی برای پاداش‌های راهزن بی‌قرار طراحی‌شده توسط LLM

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Balancing Act: Prioritization Strategies for LLM-Designed Restless Bandit Rewards
عنوان مقاله به فارسی قانون تعادل: استراتژی‌های اولویت‌بندی برای پاداش‌های راهزن بی‌قرار طراحی‌شده توسط LLM
نویسندگان Shresth Verma, Niclas Boehmer, Lingkai Kong, Milind Tambe
فرمت مقاله انگلیسی PDF
تعداد صفحات 25
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,Multiagent Systems,یادگیری ماشین , هوش مصنوعی , سیستم های چند منظوره ,
توضیحات Submitted 15 September, 2024; v1 submitted 21 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده در 15 سپتامبر 2024 ؛V1 ارسال شده 21 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

LLMs are increasingly used to design reward functions based on human preferences in Reinforcement Learning (RL). We focus on LLM-designed rewards for Restless Multi-Armed Bandits, a framework for allocating limited resources among agents. In applications such as public health, this approach empowers grassroots health workers to tailor automated allocation decisions to community needs. In the presence of multiple agents, altering the reward function based on human preferences can impact subpopulations very differently, leading to complex tradeoffs and a multi-objective resource allocation problem. We are the first to present a principled method termed Social Choice Language Model for dealing with these tradeoffs for LLM-designed rewards for multiagent planners in general and restless bandits in particular. The novel part of our model is a transparent and configurable selection component, called an adjudicator, external to the LLM that controls complex tradeoffs via a user-selected social welfare function. Our experiments demonstrate that our model reliably selects more effective, aligned, and balanced reward functions compared to purely LLM-based approaches.

چکیده به فارسی (ترجمه ماشینی)

LLM ها به طور فزاینده ای برای طراحی توابع پاداش بر اساس ترجیحات انسانی در یادگیری تقویت (RL) استفاده می شوند.ما بر روی پاداش های طراحی شده LLM برای راهزنان چند مسلح بی قرار ، چارچوبی برای تخصیص منابع محدود در بین نمایندگان تمرکز می کنیم.در برنامه های کاربردی مانند بهداشت عمومی ، این رویکرد به کارکنان بهداشت و درمان این امکان را می دهد تا تصمیمات تخصیص خودکار را به نیازهای جامعه متناسب کنند.در حضور چندین عامل ، تغییر عملکرد پاداش مبتنی بر ترجیحات انسانی می تواند زیر گروه های مختلف را تحت تأثیر قرار دهد و منجر به تجارت پیچیده و یک مشکل تخصیص منابع چند هدف شود.ما اولین کسی هستیم که یک روش اصولی را به نام الگوی زبان انتخاب اجتماعی برای مقابله با این تجارت برای پاداش های طراحی شده LLM برای برنامه ریزان چند منظوره به طور کلی و به ویژه به طور خاص راهزنان ارائه می دهیم.بخش جدید مدل ما یک مؤلفه انتخاب شفاف و قابل تنظیم است ، به نام یک داوری ، خارجی برای LLM است که از طریق یک عملکرد رفاه اجتماعی انتخاب شده توسط کاربر ، تجارت پیچیده را کنترل می کند.آزمایشات ما نشان می دهد که مدل ما به طور قابل اعتماد توابع پاداش مؤثرتر ، تراز و متعادل تر را در مقایسه با رویکردهای مبتنی بر LLM انتخاب می کند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.