کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs
چکیده
Post-training large language models (LLMs) to develop reasoning capabilities has proven effective across diverse domains, such as mathematical reasoning and code generation. However, existing methods primarily focus on improving task-specific reasoning but have not adequately addressed the model's generalization capabilities across a broader range of reasoning tasks. To tackle this challenge, we introduce Critical Planning Step Learning (CPL), which leverages Monte Carlo Tree Search (MCTS) to explore diverse planning steps in multi-step reasoning tasks. Based on long-term outcomes, CPL learns step-level planning preferences to improve the model's planning capabilities and, consequently, its general reasoning capabilities. Furthermore, while effective in many scenarios for aligning LLMs, existing preference learning approaches like Direct Preference Optimization (DPO) struggle with complex multi-step reasoning tasks due to their inability to capture fine-grained supervision at each step. We propose Step-level Advantage Preference Optimization (Step-APO), which integrates an advantage estimate for step-level preference pairs obtained via MCTS into the DPO. This enables the model to more effectively learn critical intermediate planning steps, thereby further improving its generalization in reasoning tasks. Experimental results demonstrate that our method, trained exclusively on GSM8K and MATH, not only significantly improves performance on GSM8K (+10.5%) and MATH (+6.5%), but also enhances out-of-domain reasoning benchmarks, such as ARC-C (+4.0%), BBH (+1.8%), MMLU-STEM (+2.2%), and MMLU (+0.9%).
چکیده به فارسی (ترجمه ماشینی)
پس از آموزش مدلهای بزرگ زبان (LLMS) برای توسعه قابلیت های استدلال در حوزه های متنوع ، مانند استدلال ریاضی و تولید کد ، اثبات شده است.با این حال ، روشهای موجود در درجه اول بر بهبود استدلال خاص کار متمرکز شده اند اما به اندازه کافی توانایی های تعمیم مدل را در طیف وسیعی از کارهای استدلال بررسی نکرده اند.برای مقابله با این چالش ، ما یادگیری مرحله برنامه ریزی بحرانی (CPL) را معرفی می کنیم ، که از جستجوی درخت مونت کارلو (MCTS) استفاده می کند تا مراحل برنامه ریزی متنوع را در کارهای استدلال چند مرحله ای کشف کند.بر اساس نتایج بلند مدت ، CPL ترجیحات برنامه ریزی مرحله ای را برای بهبود قابلیت های برنامه ریزی مدل و در نتیجه قابلیت های استدلال عمومی آن می آموزد.علاوه بر این ، در حالی که در بسیاری از سناریوها برای تراز کردن LLM ها مؤثر است ، رویکردهای یادگیری اولویت موجود مانند بهینه سازی اولویت مستقیم (DPO) به دلیل عدم توانایی آنها در گرفتن نظارت ریز دانه در هر مرحله ، با کارهای پیچیده چند مرحله ای مبارزه می کنند.ما بهینه سازی اولویت مزیت سطح مرحله (STEP-APO) را پیشنهاد می کنیم ، که یک برآورد مزیت برای جفت اولویت های سطح مرحله به دست آمده از طریق MCT ها را در DPO ادغام می کند.این مدل را قادر می سازد تا مراحل برنامه ریزی واسطه ای بحرانی را به طور مؤثر یاد بگیرد و در نتیجه تعمیم آن در کارهای استدلال را بهبود بخشد.نتایج تجربی نشان می دهد که روش ما ، که منحصراً روی GSM8K و ریاضی آموزش دیده است ، نه تنها عملکرد GSM8K (10.5 ٪+) و ریاضیات (6.5 ٪+) را بهبود می بخشد ، بلکه معیارهای استدلال خارج از دامنه مانند ARC-C را افزایش می دهد.(+4.0 ٪) ، BBH (+1.8 ٪) ، MMLU-STEM (+2.2 ٪) و MMLU (0.9 ٪).
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs