ترجمه فارسی مقاله تقویت ترانسفورماتورهای تصمیم گیری از قبل آموزش دیده بین دامنه با توجه تطبیقی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Enhancing Cross-domain Pre-Trained Decision Transformers with Adaptive Attention
عنوان مقاله به فارسی تقویت ترانسفورماتورهای تصمیم گیری از قبل آموزش دیده بین دامنه با توجه تطبیقی
نویسندگان Wenhao Zhao, Qiushui Xu, Linjie Xu, Lei Song, Jinyu Wang, Chunlai Zhou, Jiang Bian
فرمت مقاله انگلیسی PDF
تعداد صفحات 12
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,یادگیری ماشین ,
توضیحات Submitted 10 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده 10 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Recently, the pre-training of decision transformers (DT) using a different domain, such as natural language text, has generated significant attention in offline reinforcement learning (Offline RL). Although this cross-domain pre-training approach achieves superior performance compared to training from scratch in environments required short-term planning ability, the mechanisms by which pre-training benefits the fine-tuning phase remain unclear. Furthermore, we point out that the cross-domain pre-training approach hinders the extraction of distant information in environments like PointMaze that require long-term planning ability, leading to performance that is much worse than training DT from scratch. This work first analyzes these issues and found that Markov Matrix, a component that exists in pre-trained attention heads, is the key to explain the significant performance disparity of pre-trained models in different planning abilities. Inspired by our analysis, we propose a general method GPT-DTMA, which equips a pre-trained DT with Mixture of Attention (MoA), to enable adaptive learning and accommodating diverse attention requirements during fine-tuning. Extensive experiments demonstrate that the effectiveness of GPT-DTMA: it achieves superior performance in short-term environments compared to baselines, and in long-term environments, it mitigates the negative impact caused by Markov Matrix, achieving results comparable to those of DT trained from scratch.

چکیده به فارسی (ترجمه ماشینی)

اخیراً ، پیش از ترجمه ترانسفورماتورهای تصمیم گیری (DT) با استفاده از یک دامنه متفاوت ، مانند متن زبان طبیعی ، در یادگیری تقویت آفلاین (RL آفلاین) توجه قابل توجهی را به وجود آورده است.اگرچه این رویکرد قبل از آموزش متقابل متقابل به عملکرد برتر در مقایسه با آموزش از ابتدا در محیط های نیاز به توانایی برنامه ریزی کوتاه مدت دست پیدا می کند ، مکانیسم هایی که از طریق آن از قبل از دوره ای سود می برند ، مرحله تنظیم دقیق نامشخص است.علاوه بر این ، ما اشاره می کنیم که رویکرد قبل از آموزش متقابل متقابل مانع از استخراج اطلاعات دوردست در محیط هایی مانند Pointmaze می شود که به توانایی برنامه ریزی طولانی مدت نیاز دارند و منجر به عملکردی می شود که بسیار بدتر از آموزش DT از ابتدا است.این کار ابتدا این موضوعات را مورد تجزیه و تحلیل قرار می دهد و نشان می دهد که ماتریس مارکوف ، مؤلفه ای که در سرهای توجه از قبل آموزش دیده وجود دارد ، کلید اصلی توضیح نابرابری عملکرد قابل توجه مدل های از پیش آموزش در توانایی های مختلف برنامه ریزی است.با الهام از تجزیه و تحلیل ما ، ما یک روش کلی GPT-DTMA ، که یک DT از قبل آموزش داده شده را با مخلوط توجه (MOA) مجهز می کند ، پیشنهاد می کنیم تا یادگیری تطبیقی ​​و تطبیق نیازهای متنوع توجه را در حین تنظیم دقیق فراهم کنیم.آزمایش های گسترده نشان می دهد که اثربخشی GPT-DTMA: در محیط های کوتاه مدت در مقایسه با خطوط پایه به عملکرد برتر می رسد و در محیط های طولانی مدت ، تأثیر منفی ناشی از ماتریس مارکوف را کاهش می دهد ، و به نتایج قابل مقایسه با DT آموزش داده شده از DT آموزش می دهدخراش

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.