Submitted 3 September, 2024; originally announced September 2024. , Comments: A multi-turn direct preference learning framework for tool-integrated reasoning tasks
توضیحات به فارسی
ارسال شده در 3 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد ، نظرات: یک چارچوب یادگیری اولویت مستقیم چند چرخش برای کارهای استدلال یکپارچه ابزار
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs
چکیده
Recent studies have shown that large language models' (LLMs) mathematical problem-solving capabilities can be enhanced by integrating external tools, such as code interpreters, and employing multi-turn Chain-of-Thought (CoT) reasoning. While current methods focus on synthetic data generation and Supervised Fine-Tuning (SFT), this paper studies the complementary direct preference learning approach to further improve model performance. However, existing direct preference learning algorithms are originally designed for the single-turn chat task, and do not fully address the complexities of multi-turn reasoning and external tool integration required for tool-integrated mathematical reasoning tasks. To fill in this gap, we introduce a multi-turn direct preference learning framework, tailored for this context, that leverages feedback from code interpreters and optimizes trajectory-level preferences. This framework includes multi-turn DPO and multi-turn KTO as specific implementations. The effectiveness of our framework is validated through training of various language models using an augmented prompt set from the GSM8K and MATH datasets. Our results demonstrate substantial improvements: a supervised fine-tuned Gemma-1.1-it-7B model's performance increased from 77.5% to 83.9% on GSM8K and from 46.1% to 51.2% on MATH. Similarly, a Gemma-2-it-9B model improved from 84.1% to 86.3% on GSM8K and from 51.0% to 54.5% on MATH.
چکیده به فارسی (ترجمه ماشینی)
مطالعات اخیر نشان داده است که قابلیت های حل مسئله ریاضی مدلهای بزرگ (LLMS) با ادغام ابزارهای خارجی ، مانند مترجمان کد و استفاده از استدلال زنجیره ای چند چرخش (COT) می توانند افزایش یابد.در حالی که روش های فعلی بر تولید داده های مصنوعی متمرکز شده و نظارت دقیق (SFT) را تحت نظارت قرار می دهد ، این مقاله به بررسی رویکرد یادگیری اولویت مستقیم مکمل برای بهبود بیشتر عملکرد مدل می پردازد.با این حال ، الگوریتم های یادگیری اولویت مستقیم موجود در ابتدا برای کار چت تک به نوبه خود طراحی شده اند ، و به طور کامل به پیچیدگی های استدلال چند چرخش و ادغام ابزار خارجی مورد نیاز برای کارهای استدلال ریاضی یکپارچه ابزار پرداخته نمی شوند.برای پر کردن این شکاف ، ما یک چارچوب یادگیری اولویت مستقیم چند چرخش ، متناسب با این زمینه را معرفی می کنیم که بازخورد از مترجمان کد را اعمال می کند و ترجیحات سطح مسیر را بهینه می کند.این چارچوب شامل DPO چند چرخش و KTO چند چرخش به عنوان پیاده سازی های خاص است.اثربخشی چارچوب ما از طریق آموزش مدلهای مختلف زبان با استفاده از مجموعه سریع تقویت شده از مجموعه داده های GSM8K و ریاضی تأیید می شود.نتایج ما پیشرفت های قابل توجهی را نشان می دهد: عملکرد مدل GEMMA-1.1-IT-7B با نظارت دقیق از 77.5 ٪ به 83.9 ٪ در GSM8K و از 46.1 ٪ به 51.2 ٪ در ریاضی افزایش یافته است.به طور مشابه ، یک مدل GEMMA-2-IT-9B از 84.1 ٪ به 86.3 ٪ در GSM8K و از 51.0 ٪ به 54.5 ٪ در ریاضی بهبود یافته است.
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs