ترجمه فارسی مقاله تشخیص تطبیقی دادههای پیش از آموزش برای مدلهای زبانی بزرگ از طریق توکنهای شگفتانگیز
| عنوان مقاله به انگلیسی | Adaptive Pre-training Data Detection for Large Language Models via Surprising Tokens |
| عنوان مقاله به فارسی | تشخیص تطبیقی دادههای پیش از آموزش برای مدلهای زبانی بزرگ از طریق توکنهای شگفتانگیز |
| نویسندگان | Anqi Zhang, Chaofeng Wu |
| فرمت مقاله انگلیسی | |
| تعداد صفحات | 13 |
| دسته بندی موضوعات | Computation and Language,Cryptography and Security,Machine Learning,محاسبات و زبان , رمزنگاری و امنیت , یادگیری ماشین , |
| توضیحات | Submitted 30 July, 2024; originally announced July 2024. |
| توضیحات به فارسی | ارسال شده 30 ژوئیه 2024 ؛در ابتدا ژوئیه 2024 اعلام شد. |
قیمت: 19,000 تومان
دانلود مقاله اصل انگلیسی + خلاصه دو صفحه ای مقاله + پادکست صوتی فارسی خلاصه مقاله
با انتخاب این گزینه، علاوه بر دریافت مقاله اصلی، یک خلاصه دو صفحهای فارسی و پادکست صوتی فارسی خلاصه مقاله را نیز دریافت خواهید کرد.
قیمت: 99,000 تومان
سفارش + خلاصه دو صفحه ای مقاله + پادکست صوتی فارسی خلاصه مقاله
با انتخاب این گزینه، علاوه بر دریافت مقاله اصلی و ترجمه کامل آن، یک خلاصه دو صفحهای فارسی و پادکست صوتی فارسی خلاصه مقاله را نیز دریافت خواهید کرد.
قیمت: 520,000 تومان
زمان تحویل: 2 تا 3 روز کاری
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
-
کتاب صدها نکته فارسی (خودمونی) – نسخه PDF — زبان ساده و کاربردی
مشاهده نمونه نسخه نکات ساده -
کتاب صدها نکته رسمی فارسی – نسخه PDF — نگارش استاندارد و علمی
مشاهده نمونه نسخه نکات رسمی -
کتاب صدها پرسش و پاسخ تشریحی – نسخه PDF
— هر سؤال همراه با پاسخ کامل برای درک عمیق مفاهیم
مشاهده نمونه نسخه پرسش و پاسخ -
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع -
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
- این محصول به صورت فایل دانلودی کامل ارائه میشود.
- توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
- دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
- برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
- اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی:
واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248
تلگرام: @ma_limbs
چکیده
While large language models (LLMs) are extensively used, there are raising concerns regarding privacy, security, and copyright due to their opaque training data, which brings the problem of detecting pre-training data on the table. Current solutions to this problem leverage techniques explored in machine learning privacy such as Membership Inference Attacks (MIAs), which heavily depend on LLMs' capability of verbatim memorization. However, this reliance presents challenges, especially given the vast amount of training data and the restricted number of effective training epochs. In this paper, we propose an adaptive pre-training data detection method which alleviates this reliance and effectively amplify the identification. Our method adaptively locates textit{surprising tokens} of the input. A token is surprising to a LLM if the prediction on the token is "certain but wrong", which refers to low Shannon entropy of the probability distribution and low probability of the ground truth token at the same time. By using the prediction probability of surprising tokens to measure textit{surprising}, the detection method is achieved based on the simple hypothesis that seeing seen data is less surprising for the model compared with seeing unseen data. The method can be applied without any access to the the pre-training data corpus or additional training like reference models. Our approach exhibits a consistent enhancement compared to existing methods in diverse experiments conducted on various benchmarks and models, achieving a maximum improvement of 29.5%. We also introduce a new benchmark Dolma-Book developed upon a novel framework, which employs book data collected both before and after model training to provide further evaluation.
چکیده به فارسی (ترجمه ماشینی)
در حالی که از مدل های بزرگ زبان (LLMS) به طور گسترده مورد استفاده قرار می گیرد ، به دلیل داده های آموزش مات آنها ، نگرانی هایی در مورد حریم خصوصی ، امنیت و حق چاپ وجود دارد ، که این مسئله مشکل تشخیص داده های قبل از آموزش را در جدول ایجاد می کند.راه حل های فعلی برای این تکنیک های اهرم مشکل که در حریم خصوصی یادگیری ماشین مانند حملات استنباط عضویت (MIA) مورد بررسی قرار می گیرد ، که به شدت به توانایی LLMS از حفظ کلمه ای بستگی دارد.با این حال ، این اتکا ، به ویژه با توجه به تعداد زیادی از داده های آموزشی و تعداد محدودی از دوره های آموزشی مؤثر ، چالش هایی را ارائه می دهد.در این مقاله ، ما یک روش تشخیص داده های قبل از آموزش تطبیقی را پیشنهاد می کنیم که این اعتماد را کاهش می دهد و به طور مؤثر شناسایی را تقویت می کند.روش ما به صورت تطبیقی textit {نشانه های شگفت آور} از ورودی را پیدا می کند.اگر پیش بینی روی نشانه "قطعی اما اشتباه" باشد ، یک نشانه برای LLM تعجب آور است ، که به آنتروپی کم شانون از توزیع احتمال و احتمال کم هم در همان زمان اشاره دارد.با استفاده از احتمال پیش بینی نشانه های غافلگیرکننده برای اندازه گیری textit {شگفت آور} ، روش تشخیص بر اساس این فرضیه ساده حاصل می شود که دیدن داده های دیده شده برای مدل در مقایسه با دیدن داده های غیب کمتر تعجب آور است.این روش بدون دسترسی به داده های قبل از آموزش داده یا آموزش های اضافی مانند مدل های مرجع قابل استفاده است.رویکرد ما در مقایسه با روشهای موجود در آزمایشات متنوعی که بر روی معیارها و مدلهای مختلف انجام شده است ، پیشرفت مداوم دارد و به حداکثر بهبود 29.5 ٪ رسیده است.ما همچنین یک کتاب معیار جدید Dolma را که بر روی یک چارچوب جدید تهیه شده است ، معرفی می کنیم ، که از داده های کتاب جمع آوری شده قبل و بعد از آموزش مدل استفاده می کند تا ارزیابی بیشتر ارائه شود.📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
-
کتاب صدها نکته فارسی (خودمونی) – نسخه PDF — زبان ساده و کاربردی
مشاهده نمونه نسخه نکات ساده -
کتاب صدها نکته رسمی فارسی – نسخه PDF — نگارش استاندارد و علمی
مشاهده نمونه نسخه نکات رسمی -
کتاب صدها پرسش و پاسخ تشریحی – نسخه PDF
— هر سؤال همراه با پاسخ کامل برای درک عمیق مفاهیم
مشاهده نمونه نسخه پرسش و پاسخ -
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع -
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
- این محصول به صورت فایل دانلودی کامل ارائه میشود.
- توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
- دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
- برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
- اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی:
واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248
تلگرام: @ma_limbs
نظرات
هنوز نظری ثبت نشده است.
وارد شوید تا نظر ثبت کنید.