ترجمه فارسی مقاله ساخت عوامل ریاضی با یادگیری ترجیحی تکراری چند نوبتی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Building Math Agents with Multi-Turn Iterative Preference Learning
عنوان مقاله به فارسی ساخت عوامل ریاضی با یادگیری ترجیحی تکراری چند نوبتی
نویسندگان Wei Xiong, Chengshuai Shi, Jiaming Shen, Aviv Rosenberg, Zhen Qin, Daniele Calandriello, Misha Khalman, Rishabh Joshi, Bilal Piot, Mohammad Saleh, Chi Jin, Tong Zhang, Tianqi Liu
فرمت مقاله انگلیسی PDF
تعداد صفحات 41
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Machine Learning,یادگیری ماشین , یادگیری ماشین ,
توضیحات Submitted 3 September, 2024; originally announced September 2024. , Comments: A multi-turn direct preference learning framework for tool-integrated reasoning tasks
توضیحات به فارسی ارسال شده در 3 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد ، نظرات: یک چارچوب یادگیری اولویت مستقیم چند چرخش برای کارهای استدلال یکپارچه ابزار
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Recent studies have shown that large language models' (LLMs) mathematical problem-solving capabilities can be enhanced by integrating external tools, such as code interpreters, and employing multi-turn Chain-of-Thought (CoT) reasoning. While current methods focus on synthetic data generation and Supervised Fine-Tuning (SFT), this paper studies the complementary direct preference learning approach to further improve model performance. However, existing direct preference learning algorithms are originally designed for the single-turn chat task, and do not fully address the complexities of multi-turn reasoning and external tool integration required for tool-integrated mathematical reasoning tasks. To fill in this gap, we introduce a multi-turn direct preference learning framework, tailored for this context, that leverages feedback from code interpreters and optimizes trajectory-level preferences. This framework includes multi-turn DPO and multi-turn KTO as specific implementations. The effectiveness of our framework is validated through training of various language models using an augmented prompt set from the GSM8K and MATH datasets. Our results demonstrate substantial improvements: a supervised fine-tuned Gemma-1.1-it-7B model's performance increased from 77.5% to 83.9% on GSM8K and from 46.1% to 51.2% on MATH. Similarly, a Gemma-2-it-9B model improved from 84.1% to 86.3% on GSM8K and from 51.0% to 54.5% on MATH.

چکیده به فارسی (ترجمه ماشینی)

مطالعات اخیر نشان داده است که قابلیت های حل مسئله ریاضی مدلهای بزرگ (LLMS) با ادغام ابزارهای خارجی ، مانند مترجمان کد و استفاده از استدلال زنجیره ای چند چرخش (COT) می توانند افزایش یابد.در حالی که روش های فعلی بر تولید داده های مصنوعی متمرکز شده و نظارت دقیق (SFT) را تحت نظارت قرار می دهد ، این مقاله به بررسی رویکرد یادگیری اولویت مستقیم مکمل برای بهبود بیشتر عملکرد مدل می پردازد.با این حال ، الگوریتم های یادگیری اولویت مستقیم موجود در ابتدا برای کار چت تک به نوبه خود طراحی شده اند ، و به طور کامل به پیچیدگی های استدلال چند چرخش و ادغام ابزار خارجی مورد نیاز برای کارهای استدلال ریاضی یکپارچه ابزار پرداخته نمی شوند.برای پر کردن این شکاف ، ما یک چارچوب یادگیری اولویت مستقیم چند چرخش ، متناسب با این زمینه را معرفی می کنیم که بازخورد از مترجمان کد را اعمال می کند و ترجیحات سطح مسیر را بهینه می کند.این چارچوب شامل DPO چند چرخش و KTO چند چرخش به عنوان پیاده سازی های خاص است.اثربخشی چارچوب ما از طریق آموزش مدلهای مختلف زبان با استفاده از مجموعه سریع تقویت شده از مجموعه داده های GSM8K و ریاضی تأیید می شود.نتایج ما پیشرفت های قابل توجهی را نشان می دهد: عملکرد مدل GEMMA-1.1-IT-7B با نظارت دقیق از 77.5 ٪ به 83.9 ٪ در GSM8K و از 46.1 ٪ به 51.2 ٪ در ریاضی افزایش یافته است.به طور مشابه ، یک مدل GEMMA-2-IT-9B از 84.1 ٪ به 86.3 ٪ در GSM8K و از 51.0 ٪ به 54.5 ٪ در ریاضی بهبود یافته است.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.