ترجمه فارسی مقاله Instruct-SkillMix: خط لوله قدرتمندی برای تنظیم دستورالعمل LLM

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Instruct-SkillMix: A Powerful Pipeline for LLM Instruction Tuning
عنوان مقاله به فارسی Instruct-SkillMix: خط لوله قدرتمندی برای تنظیم دستورالعمل LLM
نویسندگان Simran Kaur, Simon Park, Anirudh Goyal, Sanjeev Arora
فرمت مقاله انگلیسی PDF
تعداد صفحات 69
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Computation and Language,یادگیری ماشین , محاسبه و زبان ,
توضیحات Submitted 9 September, 2024; v1 submitted 27 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده در 9 سپتامبر 2024 ؛V1 ارسال شده 27 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

We introduce Instruct-SkillMix, an automated approach for creating diverse, high quality SFT data. The Instruct-SkillMix pipeline involves two stages, each leveraging an existing powerful LLM: (1) Skill extraction: uses the LLM to extract core "skills" for instruction-following, either from existing datasets, or by directly prompting the model; (2) Data generation: uses the powerful LLM to generate (instruction, response) data that exhibit a randomly chosen pair of these skills. Here, the use of random skill combinations promotes diversity and difficulty. Vanilla SFT (i.e., no PPO, DPO, or RL methods) on data generated from Instruct-SkillMix leads to strong gains on instruction following benchmarks such as AlpacaEval 2.0, MT-Bench, and WildBench. With just $4$K examples, LLaMA-3-8B-Base achieves 42.76% length-controlled win rate on AlpacaEval 2.0. To our knowledge, this achieves state-of-the-art performance among all models that have only undergone SFT (no RL methods) and competes with proprietary models such as Claude 3 Opus and LLaMA-3.1-405B-Instruct. Ablation studies also suggest plausible reasons for why creating open instruction-tuning datasets via naive crowd-sourcing has proved difficult. Introducing low quality answers ("shirkers") in $20\%$ of Instruct-SkillMix examples causes performance to plummet, sometimes catastrophically. The Instruct-SkillMix pipeline is flexible and is adaptable to other settings.

چکیده به فارسی (ترجمه ماشینی)

ما Arentrish-Mkillmix را معرفی می کنیم ، یک رویکرد خودکار برای ایجاد داده های SFT متنوع و با کیفیت بالا.خط لوله آموزش مهارت شامل دو مرحله است که هر یک از آنها یک LLM قدرتمند موجود را اعمال می کند: (1) استخراج مهارت: از LLM برای استخراج "مهارتهای" اصلی برای آموزش ، یا از مجموعه داده های موجود استفاده می کند ، یا با استفاده مستقیم از مدل.(2) تولید داده: از LLM قدرتمند برای تولید داده های (دستورالعمل ، پاسخ) استفاده می کند که یک جفت انتخاب شده به طور تصادفی از این مهارت ها را نشان می دهد.در اینجا ، استفاده از ترکیب های مهارت تصادفی باعث تنوع و دشواری می شود.وانیل SFT (به عنوان مثال ، بدون روش PPO ، DPO یا RL) در مورد داده های حاصل از آموزش-آسمانیکس منجر به دستاوردهای قوی در دستورالعمل های زیر معیارهایی مانند Alpacaeval 2.0 ، MT-Bench و Wildbench می شود.Llama-3-8B-BASE با مثال فقط 4 $ $ $ ، به 42.76 ٪ نرخ پیروزی کنترل شده در Alpacaeval 2.0 می رسد.به دانش ما ، این به عملکرد پیشرفته در بین تمام مدلهایی که فقط تحت SFT (بدون روش RL) قرار گرفته اند ، به دست می آید و با مدلهای اختصاصی مانند Claude 3 Opus و Llama-3.1-405B-Instruct رقابت می کند.مطالعات فرسایش همچنین دلایل قابل قبول برای ایجاد ایجاد مجموعه داده های تنظیم دستورالعمل باز از طریق منابع ساده و بی تکلف را نشان می دهد.معرفی پاسخ های با کیفیت پایین ("shirkers") در 20 $ $ از نمونه های آموزش-Skillmix باعث کاهش عملکرد ، گاهی فاجعه بار می شود.خط لوله آموزش-Skillmix انعطاف پذیر است و با سایر تنظیمات سازگار است.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.