ترجمه فارسی مقاله ساخت مجموعه داده خودکار (ADC): جمع‌آوری نمونه، مدیریت داده و فراتر از آن

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

عنوان مقاله به انگلیسی Automatic Dataset Construction (ADC): Sample Collection, Data Curation, and Beyond
عنوان مقاله به فارسی ساخت مجموعه داده خودکار (ADC): جمع‌آوری نمونه، مدیریت داده و فراتر از آن
نویسندگان Minghao Liu, Zonglin Di, Jiaheng Wei, Zhongruo Wang, Hengxiang Zhang, Ruixuan Xiao, Haoyu Wang, Jinlong Pang, Hao Chen, Ankit Shah, Hongxin Wei, Xinlei He, Zhaowei Zhao, Haobo Wang, Lei Feng, Jindong Wang, James Davis, Yang Liu
فرمت مقاله انگلیسی PDF
تعداد صفحات 20
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Artificial Intelligence,Machine Learning,هوش مصنوعی , یادگیری ماشین ,
توضیحات Submitted 21 August, 2024; originally announced August 2024.
توضیحات به فارسی ارائه شده 21 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Large-scale data collection is essential for developing personalized training data, mitigating the shortage of training data, and fine-tuning specialized models. However, creating high-quality datasets quickly and accurately remains a challenge due to annotation errors, the substantial time and costs associated with human labor. To address these issues, we propose Automatic Dataset Construction (ADC), an innovative methodology that automates dataset creation with negligible cost and high efficiency. Taking the image classification task as a starting point, ADC leverages LLMs for the detailed class design and code generation to collect relevant samples via search engines, significantly reducing the need for manual annotation and speeding up the data generation process. Despite these advantages, ADC also encounters real-world challenges such as label errors (label noise) and imbalanced data distributions (label bias). We provide open-source software that incorporates existing methods for label error detection, robust learning under noisy and biased data, ensuring a higher-quality training data and more robust model training procedure. Furthermore, we design three benchmark datasets focused on label noise detection, label noise learning, and class-imbalanced learning. These datasets are vital because there are few existing datasets specifically for label noise detection, despite its importance. Finally, we evaluate the performance of existing popular methods on these datasets, thereby facilitating further research in the field.

چکیده به فارسی (ترجمه ماشینی)

جمع آوری داده های در مقیاس بزرگ برای توسعه داده های آموزش شخصی ، کاهش کمبود داده های آموزش و مدل های تخصصی تنظیم دقیق ضروری است.با این حال ، ایجاد مجموعه داده های با کیفیت بالا به سرعت و به طور دقیق به دلیل خطاهای حاشیه نویسی ، زمان و هزینه های قابل توجه مرتبط با کار انسان همچنان یک چالش است.برای پرداختن به این موضوعات ، ما ساخت و ساز خودکار مجموعه داده ها (ADC) ، یک روش نوآورانه را پیشنهاد می کنیم که ایجاد مجموعه داده ها را با هزینه ناچیز و راندمان بالا خودکار می کند.با استفاده از کار طبقه بندی تصویر به عنوان نقطه شروع ، ADC LLMS را برای طراحی دقیق کلاس و تولید کد برای جمع آوری نمونه های مربوطه از طریق موتورهای جستجو ، به میزان قابل توجهی نیاز به حاشیه نویسی دستی و سرعت بخشیدن به روند تولید داده را کاهش می دهد.با وجود این مزایا ، ADC همچنین با چالش های دنیای واقعی مانند خطاهای برچسب (نویز برچسب) و توزیع داده های نامتعادل (تعصب برچسب) روبرو می شود.ما نرم افزار منبع باز را ارائه می دهیم که روشهای موجود برای تشخیص خطای برچسب ، یادگیری قوی تحت داده های پر سر و صدا و مغرضانه را شامل می شود و از داده های آموزش با کیفیت بالاتر و روش آموزش مدل قوی تر اطمینان می دهیم.علاوه بر این ، ما سه مجموعه داده معیار متمرکز بر تشخیص سر و صدای برچسب ، یادگیری نویز برچسب و یادگیری کلاس تعادل را طراحی می کنیم.این مجموعه داده ها بسیار حیاتی هستند زیرا با وجود اهمیت آن ، مجموعه داده های موجود به طور خاص برای تشخیص نویز برچسب وجود دارد.سرانجام ، ما عملکرد روشهای محبوب موجود در این مجموعه داده ها را ارزیابی می کنیم و از این طریق تحقیقات بیشتر در این زمینه را تسهیل می کنیم.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.