ترجمه فارسی مقاله مدل‌های زبان بزرگ به‌عنوان جستجوگرهای تابع پاداش کارآمد برای یادگیری تقویتی چندهدفه محیطی سفارشی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Large Language Models as Efficient Reward Function Searchers for Custom-Environment Multi-Objective Reinforcement Learning
عنوان مقاله به فارسی مدل‌های زبان بزرگ به‌عنوان جستجوگرهای تابع پاداش کارآمد برای یادگیری تقویتی چندهدفه محیطی سفارشی
نویسندگان Guanwen Xie, Jingzehua Xu, Yiyuan Yang, Shuai Zhang
فرمت مقاله انگلیسی PDF
تعداد صفحات 5
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,Computation and Language,Systems and Control,یادگیری ماشین , هوش مصنوعی , محاسبات و زبان , سیستم ها و کنترل ,
توضیحات Submitted 4 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده در 4 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Leveraging large language models (LLMs) for designing reward functions demonstrates significant potential. However, achieving effective design and improvement of reward functions in reinforcement learning (RL) tasks with complex custom environments and multiple requirements presents considerable challenges. In this paper, we enable LLMs to be effective white-box searchers, highlighting their advanced semantic understanding capabilities. Specifically, we generate reward components for each explicit user requirement and employ the reward critic to identify the correct code form. Then, LLMs assign weights to the reward components to balance their values and iteratively search and optimize these weights based on the context provided by the training log analyzer, while adaptively determining the search step size. We applied the framework to an underwater information collection RL task without direct human feedback or reward examples (zero-shot). The reward critic successfully correct the reward code with only one feedback for each requirement, effectively preventing irreparable errors that can occur when reward function feedback is provided in aggregate. The effective initialization of weights enables the acquisition of different reward functions within the Pareto solution set without weight search. Even in the case where a weight is 100 times off, fewer than four iterations are needed to obtain solutions that meet user requirements. The framework also works well with most prompts utilizing GPT-3.5 Turbo, since it does not require advanced numerical understanding or calculation.

چکیده به فارسی (ترجمه ماشینی)

استفاده از مدلهای بزرگ زبان (LLM) برای طراحی توابع پاداش پتانسیل قابل توجهی را نشان می دهد.با این حال ، دستیابی به طراحی مؤثر و بهبود کارکردهای پاداش در کارهای یادگیری تقویت (RL) با محیط های سفارشی پیچیده و الزامات متعدد چالش های قابل توجهی را ارائه می دهد.در این مقاله ، ما LLM ها را قادر می سازیم تا جستجوگرهای مؤثر در جعبه سفید باشند ، و قابلیت های پیشرفته درک معنایی آنها را برجسته می کنند.به طور خاص ، ما برای هر یک از نیازهای صریح کاربر مؤلفه های پاداش تولید می کنیم و از منتقد پاداش برای شناسایی فرم کد صحیح استفاده می کنیم.سپس ، LLMS وزنه هایی را به مؤلفه های پاداش اختصاص می دهد تا مقادیر خود را متعادل کند و به طور تکراری جستجو و بهینه سازی این وزنها بر اساس زمینه ارائه شده توسط آنالایزر ورود به سیستم ، در حالی که به طور تطبیقی ​​اندازه مرحله جستجو را تعیین می کند.ما این چارچوب را به یک کار جمع آوری اطلاعات زیر آب RL بدون بازخورد مستقیم انسانی یا نمونه های پاداش (صفر-شات) اعمال کردیم.منتقد پاداش با موفقیت کد پاداش را با تنها یک بازخورد برای هر نیاز تصحیح کرد ، به طور موثری از خطاهای جبران ناپذیر جلوگیری می کند که می تواند هنگام بازخورد عملکرد پاداش در کل ارائه شود.اولیه سازی مؤثر وزن ، امکان دستیابی به عملکردهای مختلف پاداش را در مجموعه راه حل پارتو بدون جستجوی وزن فراهم می کند.حتی در مواردی که وزن 100 برابر آن باشد ، برای به دست آوردن راه حل هایی که نیازهای کاربر را برآورده می کند ، کمتر از چهار تکرار لازم است.این چارچوب همچنین با استفاده از GPT-5.5 توربو با اکثر مطالب خوب کار می کند ، زیرا نیازی به درک یا محاسبه عددی پیشرفته ندارد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.