ترجمه فارسی مقاله چشم انداز بازنمایی یادگیری چند شات و تنظیم دقیق در مدل های زبان بزرگ

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی The representation landscape of few-shot learning and fine-tuning in large language models
عنوان مقاله به فارسی چشم انداز بازنمایی یادگیری چند شات و تنظیم دقیق در مدل های زبان بزرگ
نویسندگان Diego Doimo, Alessandro Serra, Alessio Ansuini, Alberto Cazzaniga
فرمت مقاله انگلیسی PDF
تعداد صفحات 37
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computation and Language,Machine Learning,محاسبه و زبان , یادگیری ماشین ,
توضیحات Submitted 7 September, 2024; v1 submitted 5 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال 7 سپتامبر 2024 ؛V1 ارسال شده 5 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

In-context learning (ICL) and supervised fine-tuning (SFT) are two common strategies for improving the performance of modern large language models (LLMs) on specific tasks. Despite their different natures, these strategies often lead to comparable performance gains. However, little is known about whether they induce similar representations inside LLMs. We approach this problem by analyzing the probability landscape of their hidden representations in the two cases. More specifically, we compare how LLMs solve the same question-answering task, finding that ICL and SFT create very different internal structures, in both cases undergoing a sharp transition in the middle of the network. In the first half of the network, ICL shapes interpretable representations hierarchically organized according to their semantic content. In contrast, the probability landscape obtained with SFT is fuzzier and semantically mixed. In the second half of the model, the fine-tuned representations develop probability modes that better encode the identity of answers, while the landscape of ICL representations is characterized by less defined peaks. Our approach reveals the diverse computational strategies developed inside LLMs to solve the same task across different conditions, allowing us to make a step towards designing optimal methods to extract information from language models.

چکیده به فارسی (ترجمه ماشینی)

یادگیری درون متن (ICL) و تنظیم دقیق (SFT) دو استراتژی متداول برای بهبود عملکرد مدلهای بزرگ زبان بزرگ (LLM) در کارهای خاص است.با وجود طبیعت متفاوت آنها ، این استراتژی ها اغلب منجر به افزایش عملکرد قابل مقایسه می شوند.با این حال ، اطلاعات کمی در مورد اینکه آیا آنها بازنمایی های مشابه را در داخل LLMS القا می کنند ، شناخته شده است.ما با تجزیه و تحلیل چشم انداز احتمال نمایش های پنهان آنها در دو مورد به این مشکل نزدیک می شویم.به طور خاص ، ما مقایسه می کنیم که چگونه LLM ها همان کار پاسخ به سؤال را حل می کنند ، و می دانند که ICL و SFT ساختارهای داخلی بسیار متفاوتی ایجاد می کنند ، در هر دو مورد که در وسط شبکه تحت یک انتقال شدید قرار دارند.در نیمه اول شبکه ، ICL بازنمودهای قابل تفسیر سلسله مراتبی را با توجه به محتوای معنایی خود سازماندهی می کند.در مقابل ، چشم انداز احتمال به دست آمده با SFT فازی تر و از نظر معنایی مخلوط است.در نیمه دوم مدل ، بازنمایی های تنظیم شده خوب حالت های احتمالی را ایجاد می کنند که هویت پاسخ ها را بهتر رمزگذاری می کنند ، در حالی که منظره بازنمایی ICL توسط قله های کمتر تعریف شده مشخص می شود.رویکرد ما استراتژی های متنوع محاسباتی توسعه یافته در LLMS را برای حل همان کار در شرایط مختلف نشان می دهد ، و به ما امکان می دهد تا گامی را برای طراحی روشهای بهینه برای استخراج اطلاعات از مدل های زبان انجام دهیم.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.