کتاب بهینه‌سازی مدل‌های زبانی با بازخورد انسانی: از تئوری تا پیاده‌سازی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 62,488 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی

📚 محتوای این محصول آموزشی (پکیج کامل)

💡 این محصول یک نسخهٔ کامل و جامع است

تمامی محتوای آموزشی این کتاب در قالب یک بسته‌ی کامل و یکپارچه ارائه می‌شود و شامل تمام نسخه‌ها و فایل‌های موردنیاز برای یادگیری است.

🎁 محتویات کامل بسته دانلودی

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل کتاب‌ها، تمرین‌ها و خودآزمایی .


ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود و نسخهٔ چاپی ندارد.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های کتاب همانجا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

🎓 دوره آموزشی جامع

📚 اطلاعات دوره

عنوان دوره: دوره بهینه‌سازی مدل‌های زبانی با بازخورد انسانی: از تئوری تا پیاده‌سازی

موضوع کلی: هوش مصنوعی و یادگیری ماشین

موضوع میانی: یادگیری تقویتی و مدل‌های زبانی بزرگ

📋 سرفصل‌های دوره

  • 1. مقدمه‌ای بر یادگیری تقویتی
  • 2. مبانی یادگیری تقویتی: مفاهیم و اصطلاحات
  • 3. الگوریتم‌های یادگیری تقویتی پایه: Q-learning
  • 4. الگوریتم‌های یادگیری تقویتی پایه: SARSA
  • 5. الگوریتم‌های یادگیری تقویتی پایه: Policy Gradient
  • 6. توابع ارزش و تخمین آن‌ها
  • 7. تخمین سیاست و روش‌های جستجو
  • 8. مقدمه‌ای بر یادگیری تقویتی عمیق (Deep Reinforcement Learning)
  • 9. شبکه‌های عصبی در یادگیری تقویتی
  • 10. DQN (Deep Q-Network) و پیاده‌سازی آن
  • 11. Double DQN و بهبود پایداری
  • 12. Dueling DQN و تفکیک ارزش و advantage
  • 13. Prioritized Experience Replay و بهبود نمونه‌برداری
  • 14. مقدمه‌ای بر بازخورد انسانی (Human Feedback)
  • 15. جمع‌آوری داده‌های بازخورد انسانی
  • 16. مدل‌سازی بازخورد انسانی
  • 17. یادگیری با بازخورد ترجیحی (Preference-based Learning)
  • 18. مقدمه‌ای بر RLHF (Reinforcement Learning from Human Feedback)
  • 19. مراحل اصلی RLHF
  • 20. آموزش مدل پاداش (Reward Model)
  • 21. بهینه‌سازی سیاست با استفاده از مدل پاداش
  • 22. روش‌های نمونه‌برداری از سیاست (Policy Sampling)
  • 23. الگوریتم PPO (Proximal Policy Optimization) در RLHF
  • 24. الگوریتم SFT (Supervised Fine-Tuning) و نقش آن در RLHF
  • 25. ارزیابی مدل‌های RLHF
  • 26. معیارهای ارزیابی در RLHF
  • 27. مقدمه‌ای بر مدل‌های زبانی بزرگ (LLMs)
  • 28. معماری ترانسفورمر (Transformer)
  • 29. توکن‌سازی و embedding
  • 30. تولید متن با مدل‌های زبانی بزرگ
  • 31. Fine-tuning مدل‌های زبانی بزرگ
  • 32. RLHF برای بهبود پاسخگویی مدل‌های زبانی بزرگ
  • 33. RLHF برای کاهش سمّیت و تعصب در مدل‌های زبانی بزرگ
  • 34. RLHF برای کنترل سبک و لحن مدل‌های زبانی بزرگ
  • 35. مقدمه‌ای بر کنترل تولید متن
  • 36. روش‌های constrained decoding
  • 37. روش‌های penalty-based decoding
  • 38. روش‌های reinforcement learning برای کنترل تولید متن
  • 39. چالش‌های RLHF: پایداری، تعمیم و هزینه
  • 40. داده‌های بازخورد انسانی: کیفیت و تنوع
  • 41. مدل‌های پاداش: طراحی و آموزش
  • 42. بهینه‌سازی سیاست: الگوریتم‌ها و hyperparameterها
  • 43. مقایسه RLHF با روش‌های دیگر یادگیری تقویتی
  • 44. کاربردهای RLHF در پردازش زبان طبیعی
  • 45. RLHF در رباتیک و کنترل
  • 46. RLHF در بازی‌سازی
  • 47. RLHF در سیستم‌های توصیه‌گر
  • 48. ابزارهای RLHF: کتابخانه‌ها و فریم‌ورک‌ها
  • 49. مقدمه‌ای بر DeepSpeed و Megatron
  • 50. مقدمه‌ای بر Ray و RLlib
  • 51. بهینه‌سازی حافظه و محاسبات در RLHF
  • 52. محاسبات توزیع‌شده در RLHF
  • 53. مقیاس‌پذیری RLHF
  • 54. مقدمه‌ای بر امنیت و حریم خصوصی در RLHF
  • 55. حملات adversarial در RLHF
  • 56. حریم خصوصی داده‌ها در RLHF
  • 57. تفسیرپذیری مدل‌های RLHF
  • 58. تکنیک‌های تفسیرپذیری برای مدل‌های پاداش و سیاست
  • 59. آینده RLHF: تحقیقات و چالش‌ها
  • 60. ترکیب RLHF با روش‌های یادگیری دیگر
  • 61. RLHF و یادگیری چندوجهی (Multimodal Learning)
  • 62. RLHF و یادگیری پیوسته (Continual Learning)
  • 63. RLHF و یادگیری انتقالی (Transfer Learning)
  • 64. RLHF و یادگیری خودنظارتی (Self-Supervised Learning)
  • 65. پیاده‌سازی RLHF در محیط‌های واقعی
  • 66. ملاحظات عملی در استقرار RLHF
  • 67. مقایسه با روش‌های آموزش با نظارت (Supervised Learning)
  • 68. تکنیک‌های افزایش داده (Data Augmentation) در RLHF
  • 69. بهبود کارایی نمونه (Sample Efficiency) در RLHF
  • 70. تحلیل خطا در RLHF
  • 71. تکنیک‌های عیب‌یابی (Debugging) در RLHF
  • 72. مستندسازی و گزارش‌دهی در RLHF
  • 73. بهینه‌سازی هایپرپارامترها در RLHF
  • 74. استفاده از ابزارهای مانیتورینگ در RLHF
  • 75. RLHF در محیط‌های با منابع محدود
  • 76. RLHF و یادگیری فدرال (Federated Learning)
  • 77. RLHF و یادگیری فعال (Active Learning)
  • 78. RLHF و یادگیری تقویتی آفلاین (Offline Reinforcement Learning)
  • 79. مقدمه‌ای بر Robust RLHF
  • 80. RLHF و مقابله با داده‌های پرت (Outliers)
  • 81. RLHF و شناسایی حملات
  • 82. RLHF و تضمین انصاف (Fairness)

📚 محتوای این محصول آموزشی (پکیج کامل)

💡 این محصول یک نسخهٔ کامل و جامع است

تمامی محتوای آموزشی این کتاب در قالب یک بسته‌ی کامل و یکپارچه ارائه می‌شود و شامل تمام نسخه‌ها و فایل‌های موردنیاز برای یادگیری است.

🎁 محتویات کامل بسته دانلودی

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل کتاب‌ها، تمرین‌ها و خودآزمایی .


ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود و نسخهٔ چاپی ندارد.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های کتاب همانجا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.