کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs
چکیده
Recent advancements in large language models (LLMs) have enabled understanding webpage contexts, product details, and human instructions. Utilizing LLMs as the foundational architecture for either reward models or policies in reinforcement learning has gained popularity -- a notable achievement is the success of InstructGPT. RL algorithms have been instrumental in maximizing long-term customer satisfaction and avoiding short-term, myopic goals in industrial recommender systems, which often rely on deep learning models to predict immediate clicks or purchases. In this project, several RL methods are implemented and evaluated using the WebShop benchmark environment, data, simulator, and pre-trained model checkpoints. The goal is to train an RL agent to maximize the purchase reward given a detailed human instruction describing a desired product. The RL agents are developed by fine-tuning a pre-trained BERT model with various objectives, learning from preferences without a reward model, and employing contemporary training techniques such as Proximal Policy Optimization (PPO) as used in InstructGPT, and Direct Preference Optimization (DPO). This report also evaluates the RL agents trained using generative trajectories. Evaluations were conducted using Thompson sampling in the WebShop simulator environment. The simulated online experiments demonstrate that agents trained on generated trajectories exhibited comparable task performance to those trained using human trajectories. This has demonstrated an example of an extremely low-cost data-efficient way of training reinforcement learning agents. Also, with limited training time (<2hours), without utilizing any images, a DPO agent achieved a 19% success rate after approximately 3000 steps or 30 minutes of training on T4 GPUs, compared to a PPO agent, which reached a 15% success rate.
چکیده به فارسی (ترجمه ماشینی)
پیشرفت های اخیر در مدل های بزرگ زبان (LLMS) درک زمینه های صفحه وب ، جزئیات محصول و دستورالعمل های انسانی را فعال کرده است.استفاده از LLM ها به عنوان معماری بنیادی برای مدل های پاداش یا سیاست های یادگیری تقویت شده ، محبوبیت خود را به دست آورده است - یک دستاورد قابل توجه موفقیت آموزش است.الگوریتم های RL در به حداکثر رساندن رضایت از مشتری بلند مدت و جلوگیری از اهداف کوتاه مدت و میوپی در سیستم های پیشنهادی صنعتی مؤثر بوده اند ، که اغلب برای پیش بینی کلیک یا خریدهای فوری به مدل های یادگیری عمیق متکی هستند.در این پروژه ، چندین روش RL با استفاده از محیط معیار WebShop ، داده ها ، شبیه ساز ها و پاسگاه های مدل از قبل آموزش دیده اجرا و ارزیابی می شود.هدف آموزش یک عامل RL برای به حداکثر رساندن پاداش خرید با توجه به یک دستورالعمل دقیق انسانی است که یک محصول مورد نظر را توصیف می کند.عوامل RL با تنظیم دقیق یک مدل BERT از پیش آموزش داده شده با اهداف مختلف ، یادگیری از ترجیحات بدون مدل پاداش و استفاده از تکنیک های آموزش معاصر مانند بهینه سازی سیاست پروگزیمال (PPO) که در آموزش استفاده می شود ، و بهینه سازی اولویت مستقیم تهیه می شوند (DPO).این گزارش همچنین عوامل RL را که با استفاده از مسیرهای تولیدی آموزش دیده اند ، ارزیابی می کند.ارزیابی ها با استفاده از نمونه گیری تامپسون در محیط شبیه ساز WebShop انجام شد.آزمایش های آنلاین شبیه سازی شده نشان می دهد که نمایندگان آموزش دیده در مسیرهای تولید شده عملکرد کار قابل مقایسه ای را با کسانی که با استفاده از مسیرهای انسانی آموزش دیده اند ، به نمایش می گذارند.این نمونه ای از یک روش بسیار کم هزینه داده برای آموزش عوامل یادگیری تقویت کننده را نشان داده است.همچنین ، با زمان آموزش محدود (<2 ساعت) ، بدون استفاده از هرگونه تصویر ، یک عامل DPO پس از حدود 3000 مرحله یا 30 دقیقه آموزش در GPU های T4 ، در مقایسه با یک عامل PPO ، 19000 موفقیت 19 ٪ موفقیت را به دست آورد ، که به 15 ٪ موفقیت رسیدنرخ
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs