کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs
چکیده
Recently, there has been a growing interest in studying how to construct better code instruction tuning data. However, we observe Code models trained with these datasets exhibit high performance on HumanEval but perform worse on other benchmarks such as LiveCodeBench. Upon further investigation, we find that many datasets suffer from severe data leakage. After cleaning up most of the leaked data, some well-known high-quality datasets perform poorly. This discovery reveals a new challenge: identifying which dataset genuinely qualify as high-quality code instruction data. To address this, we propose an efficient code data pruning strategy for selecting good samples. Our approach is based on three dimensions: instruction complexity, response quality, and instruction diversity. Based on our selected data, we present XCoder, a family of models finetuned from LLaMA3. Our experiments show XCoder achieves new state-of-the-art performance using fewer training data, which verify the effectiveness of our data strategy. Moreover, we perform a comprehensive analysis on the data composition and find existing code datasets have different characteristics according to their construction methods, which provide new insights for future code LLMs. Our models and dataset are released in https://github.com/banksy23/XCoder
چکیده به فارسی (ترجمه ماشینی)
اخیراً ، علاقه فزاینده ای به مطالعه نحوه ساخت داده های تنظیم بهتر دستورالعمل کد وجود داشته است.با این حال ، ما مدل های کد را که با این مجموعه داده ها آموزش دیده اند ، عملکرد بالایی را در Humaneval نشان می دهیم اما در سایر معیارهای مانند LiveCodebench بدتر عمل می کنند.پس از بررسی های بیشتر ، متوجه می شویم که بسیاری از مجموعه داده ها از نشت شدید داده ها رنج می برند.پس از تمیز کردن بیشتر داده های فاش شده ، برخی از مجموعه داده های با کیفیت بالا مشهور عملکرد ضعیفی دارند.این کشف یک چالش جدید را نشان می دهد: شناسایی کدام مجموعه داده ها واقعاً به عنوان داده های دستورالعمل کد با کیفیت بالا واجد شرایط هستند.برای پرداختن به این موضوع ، ما یک استراتژی هرس داده های کد کارآمد برای انتخاب نمونه های خوب پیشنهاد می کنیم.رویکرد ما مبتنی بر سه بعد است: پیچیدگی دستورالعمل ، کیفیت پاسخ و تنوع دستورالعمل.بر اساس داده های انتخاب شده ما ، XCoder ، خانواده ای از مدل هایی که از LLAMA3 استفاده شده اند ، ارائه می دهیم.آزمایشات ما نشان می دهد که XCoder با استفاده از داده های آموزش کمتری ، عملکرد جدید و پیشرفته را به دست می آورد ، که اثربخشی استراتژی داده های ما را تأیید می کند.علاوه بر این ، ما یک تجزیه و تحلیل جامع در مورد ترکیب داده ها انجام می دهیم و می یابیم که مجموعه داده های کد موجود دارای ویژگی های متفاوتی با توجه به روش های ساخت و ساز آنها هستند که بینش جدیدی را برای LLM های کد آینده ارائه می دهد.مدل ها و مجموعه داده های ما در https://github.com/banksy23/xcoder منتشر می شوند
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs