ترجمه فارسی مقاله تنظیم دقیق غیرآموزشی: فعال کردن قابلیت‌های پیگیری آموزش در مدل‌های زبان از پیش آموزش‌دیده بدون داده‌های دنبال‌کننده دستورالعمل

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Non-instructional Fine-tuning: Enabling Instruction-Following Capabilities in Pre-trained Language Models without Instruction-Following Data
عنوان مقاله به فارسی تنظیم دقیق غیرآموزشی: فعال کردن قابلیت‌های پیگیری آموزش در مدل‌های زبان از پیش آموزش‌دیده بدون داده‌های دنبال‌کننده دستورالعمل
نویسندگان Juncheng Xie, Shensian Syu, Hung-yi Lee
فرمت مقاله انگلیسی PDF
تعداد صفحات 16
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computation and Language,Artificial Intelligence,Machine Learning,محاسبه و زبان , هوش مصنوعی , یادگیری ماشین ,
توضیحات Submitted 26 August, 2024; originally announced September 2024. , Comments: 16 pages, 2 figures, 15 tables
توضیحات به فارسی ارسال شده در 26 اوت 2024 ؛در ابتدا سپتامبر 2024 اعلام شد ، نظرات: 16 صفحه ، 2 شکل ، 15 جدول
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Instruction fine-tuning is crucial for today's large language models (LLMs) to learn to follow instructions and align with human preferences. Conventionally, supervised data, including the instruction and the correct response, is required for instruction fine-tuning. To obtain such data, some researchers prompted well-trained models like GPT-4 to generate instructions and correct responses. In this paper, we propose a novel approach that uses the first half of a random text from OpenWebText as the instruction and GPT-3.5-turbo or GPT-4-turbo to complete the text as the response. Despite the data being "non-instructional", we found that pre-trained LLMs fine-tuned on this data can gain instruction-following capabilities. This observation is verified by fine-tuning several well-known pre-trained LLMs (e.g., LLaMA-2-7B, LLaMA-3-8B, LLaMA-3-70B, Mistral-7B-v0.1). The "non-instructional data" also improved some models that underwent supervised fine-tuning and human preference alignment. Our LLaMA-3-70B-Instruct fine-tuned through "non-instructional data" is comparable with LLaMA-3.1-70B-Instruct on the Arena Hard leaderboard. We analyzed the "non-instructional data" and ensured it is devoid of content related to instruction fine-tuning. Our findings will inspire further investigation into how to develop instruction-following capabilities without explicit instruction-related data.

چکیده به فارسی (ترجمه ماشینی)

تنظیم دقیق دستورالعمل برای مدل های بزرگ زبان امروز (LLMS) بسیار مهم است که از دستورالعمل ها پیروی کنند و با ترجیحات انسانی هماهنگ شوند.به طور معمول ، داده های نظارت شده ، از جمله دستورالعمل و پاسخ صحیح ، برای تنظیم دقیق دستورالعمل لازم است.برای به دست آوردن چنین داده هایی ، برخی از محققان مدلهای آموزش دیده مانند GPT-4 را برای تولید دستورالعمل ها و پاسخ های صحیح برانگیختند.در این مقاله ، ما یک رویکرد جدید را پیشنهاد می کنیم که از نیمه اول یک متن تصادفی از OpenWebText به عنوان دستورالعمل و GPT-5.5-توربو یا GPT-4-توربو استفاده می کند تا متن را به عنوان پاسخ تکمیل کند.علیرغم داده ها "غیر منتظره" ، ما دریافتیم که LLMS از قبل آموزش دیده که بر روی این داده ها تنظیم شده اند می توانند قابلیت های پیروی از دستورالعمل را بدست آورند.این مشاهدات با تنظیم دقیق چندین LLM شناخته شده از پیش آموزش دیده تأیید شده است (به عنوان مثال ، Llama-2-7B ، Llama-3-8B ، Llama-3-70B ، Mistral-7B-V0.1)."داده های غیر تحریک آمیز" همچنین برخی از مدلهایی را که تحت نظارت دقیق و تراز ترجیح انسان قرار گرفتند ، بهبود بخشید.LLAMA-3-70B-Instruct ما از طریق "داده های غیرقانونی" تنظیم شده است با مدرک LLAMA-3.1-70B در تابلوی سخت Arena قابل مقایسه است.ما "داده های غیرقانونی" را مورد تجزیه و تحلیل قرار دادیم و اطمینان دادیم که عاری از محتوای مربوط به تنظیم دقیق دستورالعمل است.یافته های ما الهام بخش تحقیقات بیشتر در مورد چگونگی توسعه قابلیت های پیروی از دستورالعمل بدون داده های صریح مربوط به دستورالعمل خواهد بود.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.