ترجمه فارسی مقاله LLM های کد شما چگونه عمل می کنند؟توانمندسازی تنظیم دستورالعمل کد با داده های با کیفیت بالا

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی How Do Your Code LLMs Perform? Empowering Code Instruction Tuning with High-Quality Data
عنوان مقاله به فارسی LLM های کد شما چگونه عمل می کنند؟توانمندسازی تنظیم دستورالعمل کد با داده های با کیفیت بالا
نویسندگان Yejie Wang, Keqing He, Dayuan Fu, Zhuoma Gongque, Heyang Xu, Yanxu Chen, Zhexu Wang, Yujia Fu, Guanting Dong, Muxi Diao, Jingang Wang, Mengdi Zhang, Xunliang Cai, Weiran Xu
فرمت مقاله انگلیسی PDF
تعداد صفحات 17
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Software Engineering,Artificial Intelligence,Computation and Language,Machine Learning,مهندسی نرم افزار , هوش مصنوعی , محاسبات و زبان , یادگیری ماشین ,
توضیحات Submitted 5 September, 2024; originally announced September 2024. , Comments: Working in progress
توضیحات به فارسی ارسال شده در 5 سپتامبر 2024 ؛در ابتدا در سپتامبر 2024 اعلام شد ، نظرات: کار در حال انجام
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Recently, there has been a growing interest in studying how to construct better code instruction tuning data. However, we observe Code models trained with these datasets exhibit high performance on HumanEval but perform worse on other benchmarks such as LiveCodeBench. Upon further investigation, we find that many datasets suffer from severe data leakage. After cleaning up most of the leaked data, some well-known high-quality datasets perform poorly. This discovery reveals a new challenge: identifying which dataset genuinely qualify as high-quality code instruction data. To address this, we propose an efficient code data pruning strategy for selecting good samples. Our approach is based on three dimensions: instruction complexity, response quality, and instruction diversity. Based on our selected data, we present XCoder, a family of models finetuned from LLaMA3. Our experiments show XCoder achieves new state-of-the-art performance using fewer training data, which verify the effectiveness of our data strategy. Moreover, we perform a comprehensive analysis on the data composition and find existing code datasets have different characteristics according to their construction methods, which provide new insights for future code LLMs. Our models and dataset are released in https://github.com/banksy23/XCoder

چکیده به فارسی (ترجمه ماشینی)

اخیراً ، علاقه فزاینده ای به مطالعه نحوه ساخت داده های تنظیم بهتر دستورالعمل کد وجود داشته است.با این حال ، ما مدل های کد را که با این مجموعه داده ها آموزش دیده اند ، عملکرد بالایی را در Humaneval نشان می دهیم اما در سایر معیارهای مانند LiveCodebench بدتر عمل می کنند.پس از بررسی های بیشتر ، متوجه می شویم که بسیاری از مجموعه داده ها از نشت شدید داده ها رنج می برند.پس از تمیز کردن بیشتر داده های فاش شده ، برخی از مجموعه داده های با کیفیت بالا مشهور عملکرد ضعیفی دارند.این کشف یک چالش جدید را نشان می دهد: شناسایی کدام مجموعه داده ها واقعاً به عنوان داده های دستورالعمل کد با کیفیت بالا واجد شرایط هستند.برای پرداختن به این موضوع ، ما یک استراتژی هرس داده های کد کارآمد برای انتخاب نمونه های خوب پیشنهاد می کنیم.رویکرد ما مبتنی بر سه بعد است: پیچیدگی دستورالعمل ، کیفیت پاسخ و تنوع دستورالعمل.بر اساس داده های انتخاب شده ما ، XCoder ، خانواده ای از مدل هایی که از LLAMA3 استفاده شده اند ، ارائه می دهیم.آزمایشات ما نشان می دهد که XCoder با استفاده از داده های آموزش کمتری ، عملکرد جدید و پیشرفته را به دست می آورد ، که اثربخشی استراتژی داده های ما را تأیید می کند.علاوه بر این ، ما یک تجزیه و تحلیل جامع در مورد ترکیب داده ها انجام می دهیم و می یابیم که مجموعه داده های کد موجود دارای ویژگی های متفاوتی با توجه به روش های ساخت و ساز آنها هستند که بینش جدیدی را برای LLM های کد آینده ارائه می دهد.مدل ها و مجموعه داده های ما در https://github.com/banksy23/xcoder منتشر می شوند

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.