ترجمه فارسی مقاله CPL: یادگیری مرحله ای برنامه ریزی انتقادی، تعمیم LLM را در وظایف استدلالی تقویت می کند

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی CPL: Critical Planning Step Learning Boosts LLM Generalization in Reasoning Tasks
عنوان مقاله به فارسی CPL: یادگیری مرحله ای برنامه ریزی انتقادی، تعمیم LLM را در وظایف استدلالی تقویت می کند
نویسندگان Tianlong Wang, Xueting Han, Jing Bai
فرمت مقاله انگلیسی PDF
تعداد صفحات 15
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Artificial Intelligence,Machine Learning,هوش مصنوعی , یادگیری ماشین ,
توضیحات Submitted 13 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده 13 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Post-training large language models (LLMs) to develop reasoning capabilities has proven effective across diverse domains, such as mathematical reasoning and code generation. However, existing methods primarily focus on improving task-specific reasoning but have not adequately addressed the model's generalization capabilities across a broader range of reasoning tasks. To tackle this challenge, we introduce Critical Planning Step Learning (CPL), which leverages Monte Carlo Tree Search (MCTS) to explore diverse planning steps in multi-step reasoning tasks. Based on long-term outcomes, CPL learns step-level planning preferences to improve the model's planning capabilities and, consequently, its general reasoning capabilities. Furthermore, while effective in many scenarios for aligning LLMs, existing preference learning approaches like Direct Preference Optimization (DPO) struggle with complex multi-step reasoning tasks due to their inability to capture fine-grained supervision at each step. We propose Step-level Advantage Preference Optimization (Step-APO), which integrates an advantage estimate for step-level preference pairs obtained via MCTS into the DPO. This enables the model to more effectively learn critical intermediate planning steps, thereby further improving its generalization in reasoning tasks. Experimental results demonstrate that our method, trained exclusively on GSM8K and MATH, not only significantly improves performance on GSM8K (+10.5%) and MATH (+6.5%), but also enhances out-of-domain reasoning benchmarks, such as ARC-C (+4.0%), BBH (+1.8%), MMLU-STEM (+2.2%), and MMLU (+0.9%).

چکیده به فارسی (ترجمه ماشینی)

پس از آموزش مدلهای بزرگ زبان (LLMS) برای توسعه قابلیت های استدلال در حوزه های متنوع ، مانند استدلال ریاضی و تولید کد ، اثبات شده است.با این حال ، روشهای موجود در درجه اول بر بهبود استدلال خاص کار متمرکز شده اند اما به اندازه کافی توانایی های تعمیم مدل را در طیف وسیعی از کارهای استدلال بررسی نکرده اند.برای مقابله با این چالش ، ما یادگیری مرحله برنامه ریزی بحرانی (CPL) را معرفی می کنیم ، که از جستجوی درخت مونت کارلو (MCTS) استفاده می کند تا مراحل برنامه ریزی متنوع را در کارهای استدلال چند مرحله ای کشف کند.بر اساس نتایج بلند مدت ، CPL ترجیحات برنامه ریزی مرحله ای را برای بهبود قابلیت های برنامه ریزی مدل و در نتیجه قابلیت های استدلال عمومی آن می آموزد.علاوه بر این ، در حالی که در بسیاری از سناریوها برای تراز کردن LLM ها مؤثر است ، رویکردهای یادگیری اولویت موجود مانند بهینه سازی اولویت مستقیم (DPO) به دلیل عدم توانایی آنها در گرفتن نظارت ریز دانه در هر مرحله ، با کارهای پیچیده چند مرحله ای مبارزه می کنند.ما بهینه سازی اولویت مزیت سطح مرحله (STEP-APO) را پیشنهاد می کنیم ، که یک برآورد مزیت برای جفت اولویت های سطح مرحله به دست آمده از طریق MCT ها را در DPO ادغام می کند.این مدل را قادر می سازد تا مراحل برنامه ریزی واسطه ای بحرانی را به طور مؤثر یاد بگیرد و در نتیجه تعمیم آن در کارهای استدلال را بهبود بخشد.نتایج تجربی نشان می دهد که روش ما ، که منحصراً روی GSM8K و ریاضی آموزش دیده است ، نه تنها عملکرد GSM8K (10.5 ٪+) و ریاضیات (6.5 ٪+) را بهبود می بخشد ، بلکه معیارهای استدلال خارج از دامنه مانند ARC-C را افزایش می دهد.(+4.0 ٪) ، BBH (+1.8 ٪) ، MMLU-STEM (+2.2 ٪) و MMLU (0.9 ٪).

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.