ترجمه فارسی مقاله دادگاه دعاوی کوچک برای NLP: داوری استراتژی های طبقه بندی متون قانونی با مجموعه داده های کوچک

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی A Small Claims Court for the NLP: Judging Legal Text Classification Strategies With Small Datasets
عنوان مقاله به فارسی دادگاه دعاوی کوچک برای NLP: داوری استراتژی های طبقه بندی متون قانونی با مجموعه داده های کوچک
نویسندگان Mariana Yukari Noguti, Edduardo Vellasques, Luiz Eduardo Soares Oliveira
فرمت مقاله انگلیسی PDF
تعداد صفحات 7
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computation and Language,Machine Learning,محاسبه و زبان , یادگیری ماشین ,
توضیحات Submitted 9 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده در 9 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Recent advances in language modelling has significantly decreased the need of labelled data in text classification tasks. Transformer-based models, pre-trained on unlabeled data, can outmatch the performance of models trained from scratch for each task. However, the amount of labelled data need to fine-tune such type of model is still considerably high for domains requiring expert-level annotators, like the legal domain. This paper investigates the best strategies for optimizing the use of a small labeled dataset and large amounts of unlabeled data and perform a classification task in the legal area with 50 predefined topics. More specifically, we use the records of demands to a Brazilian Public Prosecutor's Office aiming to assign the descriptions in one of the subjects, which currently demands deep legal knowledge for manual filling. The task of optimizing the performance of classifiers in this scenario is especially challenging, given the low amount of resources available regarding the Portuguese language, especially in the legal domain. Our results demonstrate that classic supervised models such as logistic regression and SVM and the ensembles random forest and gradient boosting achieve better performance along with embeddings extracted with word2vec when compared to BERT language model. The latter demonstrates superior performance in association with the architecture of the model itself as a classifier, having surpassed all previous models in that regard. The best result was obtained with Unsupervised Data Augmentation (UDA), which jointly uses BERT, data augmentation, and strategies of semi-supervised learning, with an accuracy of 80.7% in the aforementioned task.

چکیده به فارسی (ترجمه ماشینی)

پیشرفت های اخیر در مدل سازی زبان ، نیاز به داده های برچسب زده شده در کارهای طبقه بندی متن را به میزان قابل توجهی کاهش داده است.مدل های مبتنی بر ترانسفورماتور ، از قبل آموزش داده شده در داده های بدون برچسب ، می توانند از عملکرد مدل های آموزش داده شده از ابتدا برای هر کار پیشی بگیرند.با این حال ، مقدار داده های دارای برچسب نیاز به تنظیم دقیق چنین نوع مدل برای دامنه هایی دارد که نیاز به حاشیه نویسی در سطح متخصص دارند ، مانند دامنه قانونی.در این مقاله بهترین استراتژی ها برای بهینه سازی استفاده از یک مجموعه داده کوچک و مقادیر زیادی از داده های بدون برچسب و انجام یک کار طبقه بندی در حوزه حقوقی با 50 موضوع از پیش تعریف شده بررسی شده است.به طور خاص ، ما از سوابق خواسته ها به دادستانی عمومی برزیل با هدف اختصاص توضیحات در یکی از موضوعات استفاده می کنیم ، که در حال حاضر دانش حقوقی عمیق را برای پر کردن دستی می طلبد.با توجه به میزان کم منابع موجود در مورد زبان پرتغالی ، به ویژه در حوزه قانونی ، وظیفه بهینه سازی عملکرد طبقه بندی کننده ها در این سناریو به ویژه چالش برانگیز است.نتایج ما نشان می دهد که مدل های تحت نظارت کلاسیک مانند رگرسیون لجستیک و SVM و گروه های Random Forest و Gradient Rosting به همراه تعبیه شده با Word2VEC در مقایسه با مدل زبان BERT ، عملکرد بهتری دارند.دومی عملکرد برتر را در ارتباط با معماری مدل خود به عنوان طبقه بندی کننده نشان می دهد ، و از تمام مدلهای قبلی در این زمینه پیشی گرفته است.بهترین نتیجه با افزایش داده های بدون نظارت (UDA) ، که به طور مشترک از BERT ، افزایش داده ها و استراتژی های یادگیری نیمه تحت نظارت استفاده می شود ، با دقت 80.7 ٪ در کار فوق استفاده شد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.