ترجمه فارسی مقاله تطبیق توزیع آنتروپیک در تنظیم دقیق نظارت شده LLM: بیش از حد مناسب کمتر و تنوع بهتر

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Entropic Distribution Matching in Supervised Fine-tuning of LLMs: Less Overfitting and Better Diversity
عنوان مقاله به فارسی تطبیق توزیع آنتروپیک در تنظیم دقیق نظارت شده LLM: بیش از حد مناسب کمتر و تنوع بهتر
نویسندگان Ziniu Li, Congliang Chen, Tian Xu, Zeyu Qin, Jiancong Xiao, Ruoyu Sun, Zhi-Quan Luo
فرمت مقاله انگلیسی PDF
تعداد صفحات 28
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,یادگیری ماشین , هوش مصنوعی ,
توضیحات Submitted 29 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده 29 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Large language models rely on Supervised Fine-Tuning (SFT) to specialize in downstream tasks. Cross Entropy (CE) loss is the de facto choice in SFT, but it often leads to overfitting and limited output diversity due to its aggressive updates to the data distribution. This paper aim to address these issues by introducing the maximum entropy principle, which favors models with flatter distributions that still effectively capture the data. Specifically, we develop a new distribution matching method called GEM, which solves reverse Kullback-Leibler divergence minimization with an entropy regularizer. For the SFT of Llama-3-8B models, GEM outperforms CE in several aspects. First, when applied to the UltraFeedback dataset to develop general instruction-following abilities, GEM exhibits reduced overfitting, evidenced by lower perplexity and better performance on the IFEval benchmark. Furthermore, GEM enhances output diversity, leading to performance gains of up to 7 points on math reasoning and code generation tasks using best-of-n sampling, even without domain-specific data. Second, when fine-tuning with domain-specific datasets for math reasoning and code generation, GEM also shows less overfitting and improvements of up to 10 points compared with CE.

چکیده به فارسی (ترجمه ماشینی)

مدل های بزرگ زبان برای تخصص در کارهای پایین دست به تنظیم دقیق (SFT) متکی هستند.ضرر متقابل آنتروپی (CE) انتخاب de facto در SFT است ، اما اغلب به دلیل به روزرسانی های تهاجمی در توزیع داده ها منجر به تنوع بیش از حد و محدود می شود.این مقاله با معرفی حداکثر اصل آنتروپی ، که از مدل هایی با توزیع مسطح تر که هنوز هم به طور مؤثر داده ها را ضبط می کنند ، به این موضوعات پرداخته می شود.به طور خاص ، ما یک روش جدید تطبیق توزیع به نام GEM ایجاد می کنیم ، که به حداقل رساندن واگرایی Kullback-Leibler با یک تنظیم کننده آنتروپی حل می شود.برای SFT مدل های Llama-3-8B ، GEM از جنبه های مختلفی بهتر است.اول ، هنگامی که برای توسعه توانایی های عمومی در مورد مجموعه داده های فوق الذکر استفاده می شود ، نمایشگاه های GEM باعث کاهش بیش از حد می شوند ، که توسط دچار دفع پایین تر و عملکرد بهتر در معیار IFEVAL مشهود است.علاوه بر این ، GEM باعث افزایش تنوع خروجی می شود و منجر به افزایش عملکرد حداکثر 7 امتیاز در استدلال ریاضی و کارهای تولید کد با استفاده از نمونه گیری از بهترین-N ، حتی بدون داده های خاص دامنه می شود.دوم ، هنگامی که تنظیم دقیق با مجموعه داده های خاص دامنه برای استدلال ریاضی و تولید کد ، GEM همچنین در مقایسه با CE ، بیش از حد و پیشرفت های کمتری را نشان می دهد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.