ترجمه فارسی مقاله یک عامل یادگیری تقویتی مبتنی بر LLM بسیار کارآمد و مولد برای توصیه کنندگان

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی An Extremely Data-efficient and Generative LLM-based Reinforcement Learning Agent for Recommenders
عنوان مقاله به فارسی یک عامل یادگیری تقویتی مبتنی بر LLM بسیار کارآمد و مولد برای توصیه کنندگان
نویسندگان Shuang Feng, Grace Feng
فرمت مقاله انگلیسی PDF
تعداد صفحات 6
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,Information Retrieval,یادگیری ماشین , هوش مصنوعی , بازیابی اطلاعات ,
توضیحات Submitted 28 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده 28 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Recent advancements in large language models (LLMs) have enabled understanding webpage contexts, product details, and human instructions. Utilizing LLMs as the foundational architecture for either reward models or policies in reinforcement learning has gained popularity -- a notable achievement is the success of InstructGPT. RL algorithms have been instrumental in maximizing long-term customer satisfaction and avoiding short-term, myopic goals in industrial recommender systems, which often rely on deep learning models to predict immediate clicks or purchases. In this project, several RL methods are implemented and evaluated using the WebShop benchmark environment, data, simulator, and pre-trained model checkpoints. The goal is to train an RL agent to maximize the purchase reward given a detailed human instruction describing a desired product. The RL agents are developed by fine-tuning a pre-trained BERT model with various objectives, learning from preferences without a reward model, and employing contemporary training techniques such as Proximal Policy Optimization (PPO) as used in InstructGPT, and Direct Preference Optimization (DPO). This report also evaluates the RL agents trained using generative trajectories. Evaluations were conducted using Thompson sampling in the WebShop simulator environment. The simulated online experiments demonstrate that agents trained on generated trajectories exhibited comparable task performance to those trained using human trajectories. This has demonstrated an example of an extremely low-cost data-efficient way of training reinforcement learning agents. Also, with limited training time (<2hours), without utilizing any images, a DPO agent achieved a 19% success rate after approximately 3000 steps or 30 minutes of training on T4 GPUs, compared to a PPO agent, which reached a 15% success rate.

چکیده به فارسی (ترجمه ماشینی)

پیشرفت های اخیر در مدل های بزرگ زبان (LLMS) درک زمینه های صفحه وب ، جزئیات محصول و دستورالعمل های انسانی را فعال کرده است.استفاده از LLM ها به عنوان معماری بنیادی برای مدل های پاداش یا سیاست های یادگیری تقویت شده ، محبوبیت خود را به دست آورده است - یک دستاورد قابل توجه موفقیت آموزش است.الگوریتم های RL در به حداکثر رساندن رضایت از مشتری بلند مدت و جلوگیری از اهداف کوتاه مدت و میوپی در سیستم های پیشنهادی صنعتی مؤثر بوده اند ، که اغلب برای پیش بینی کلیک یا خریدهای فوری به مدل های یادگیری عمیق متکی هستند.در این پروژه ، چندین روش RL با استفاده از محیط معیار WebShop ، داده ها ، شبیه ساز ها و پاسگاه های مدل از قبل آموزش دیده اجرا و ارزیابی می شود.هدف آموزش یک عامل RL برای به حداکثر رساندن پاداش خرید با توجه به یک دستورالعمل دقیق انسانی است که یک محصول مورد نظر را توصیف می کند.عوامل RL با تنظیم دقیق یک مدل BERT از پیش آموزش داده شده با اهداف مختلف ، یادگیری از ترجیحات بدون مدل پاداش و استفاده از تکنیک های آموزش معاصر مانند بهینه سازی سیاست پروگزیمال (PPO) که در آموزش استفاده می شود ، و بهینه سازی اولویت مستقیم تهیه می شوند (DPO).این گزارش همچنین عوامل RL را که با استفاده از مسیرهای تولیدی آموزش دیده اند ، ارزیابی می کند.ارزیابی ها با استفاده از نمونه گیری تامپسون در محیط شبیه ساز WebShop انجام شد.آزمایش های آنلاین شبیه سازی شده نشان می دهد که نمایندگان آموزش دیده در مسیرهای تولید شده عملکرد کار قابل مقایسه ای را با کسانی که با استفاده از مسیرهای انسانی آموزش دیده اند ، به نمایش می گذارند.این نمونه ای از یک روش بسیار کم هزینه داده برای آموزش عوامل یادگیری تقویت کننده را نشان داده است.همچنین ، با زمان آموزش محدود (<2 ساعت) ، بدون استفاده از هرگونه تصویر ، یک عامل DPO پس از حدود 3000 مرحله یا 30 دقیقه آموزش در GPU های T4 ، در مقایسه با یک عامل PPO ، 19000 موفقیت 19 ٪ موفقیت را به دست آورد ، که به 15 ٪ موفقیت رسیدنرخ

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.