ترجمه فارسی مقاله مجموعه داده خود را بسازید: تولید مجموعه داده مصنوعی ویژه کار از طریق بازیابی و تقویت بدنه

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی CRAFT Your Dataset: Task-Specific Synthetic Dataset Generation Through Corpus Retrieval and Augmentation
عنوان مقاله به فارسی مجموعه داده خود را بسازید: تولید مجموعه داده مصنوعی ویژه کار از طریق بازیابی و تقویت بدنه
نویسندگان Ingo Ziegler, Abdullatif Köksal, Desmond Elliott, Hinrich Schütze
فرمت مقاله انگلیسی PDF
تعداد صفحات 23
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computation and Language,Artificial Intelligence,Machine Learning,محاسبه و زبان , هوش مصنوعی , یادگیری ماشین ,
توضیحات Submitted 3 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده در 3 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Building high-quality datasets for specialized tasks is a time-consuming and resource-intensive process that often requires specialized domain knowledge. We propose Corpus Retrieval and Augmentation for Fine-Tuning (CRAFT), a method for generating synthetic datasets, given a small number of user-written few-shots that demonstrate the task to be performed. Given the few-shot examples, we use large-scale public web-crawled corpora and similarity-based document retrieval to find other relevant human-written documents. Lastly, instruction-tuned large language models (LLMs) augment the retrieved documents into custom-formatted task samples, which then can be used for fine-tuning. We demonstrate that CRAFT can efficiently generate large-scale task-specific training datasets for four diverse tasks: biology question-answering (QA), medicine QA and commonsense QA as well as summarization. Our experiments show that CRAFT-based models outperform or achieve comparable performance to general LLMs for QA tasks, while CRAFT-based summarization models outperform models trained on human-curated data by 46 preference points.

چکیده به فارسی (ترجمه ماشینی)

ساختن مجموعه داده های با کیفیت بالا برای کارهای تخصصی یک فرآیند وقت گیر و پر فشار است که اغلب به دانش دامنه تخصصی نیاز دارد.ما با توجه به تعداد کمی از عکسهای چند نوشته شده توسط کاربر که نشان دهنده کار انجام شده است ، بازیابی و تقویت Corpus را برای تنظیم دقیق (CRAFT) پیشنهاد می کنیم ، روشی برای تولید مجموعه داده های مصنوعی.با توجه به نمونه های چند عکس ، ما از بازیابی اسناد و مدارک مبتنی بر شباهت در مقیاس بزرگ و بازیابی اسناد مبتنی بر شباهت استفاده می کنیم تا سایر اسناد مربوط به انسانی را پیدا کنیم.سرانجام ، مدل های زبان بزرگ تنظیم شده توسط دستورالعمل (LLMS) اسناد بازیابی شده را در نمونه های کار با فرمت سفارشی تقویت می کنند ، که در این صورت می توان برای تنظیم دقیق استفاده کرد.ما نشان می دهیم که CRAFT می تواند به طور مؤثر مجموعه داده های آموزشی خاص کار در مقیاس بزرگ را برای چهار کار متنوع تولید کند: پرسش بر زبان زیست شناسی (QA) ، پزشکی QA و QA Commonsense و همچنین خلاصه.آزمایشات ما نشان می دهد که مدل های مبتنی بر کاردستی از عملکردهای قابل مقایسه با LLM های عمومی برای کارهای QA بهتر عمل می کنند ، در حالی که مدل های خلاصه مبتنی بر کاردستی از مدل های بهتر آموزش داده شده بر روی داده های انسانی با 46 نقطه اولویت استفاده می کنند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.