ترجمه فارسی مقاله سمت تاریک بازخورد انسانی: مسموم کردن مدل های زبان بزرگ از طریق ورودی های کاربر

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی The Dark Side of Human Feedback: Poisoning Large Language Models via User Inputs
عنوان مقاله به فارسی سمت تاریک بازخورد انسانی: مسموم کردن مدل های زبان بزرگ از طریق ورودی های کاربر
نویسندگان Bocheng Chen, Hanqing Guo, Guangjing Wang, Yuanda Wang, Qiben Yan
فرمت مقاله انگلیسی PDF
تعداد صفحات 17
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computation and Language,Artificial Intelligence,Cryptography and Security,Machine Learning,محاسبات و زبان , هوش مصنوعی , رمزنگاری و امنیت , یادگیری ماشین ,
توضیحات Submitted 1 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال 1 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Large Language Models (LLMs) have demonstrated great capabilities in natural language understanding and generation, largely attributed to the intricate alignment process using human feedback. While alignment has become an essential training component that leverages data collected from user queries, it inadvertently opens up an avenue for a new type of user-guided poisoning attacks. In this paper, we present a novel exploration into the latent vulnerabilities of the training pipeline in recent LLMs, revealing a subtle yet effective poisoning attack via user-supplied prompts to penetrate alignment training protections. Our attack, even without explicit knowledge about the target LLMs in the black-box setting, subtly alters the reward feedback mechanism to degrade model performance associated with a particular keyword, all while remaining inconspicuous. We propose two mechanisms for crafting malicious prompts: (1) the selection-based mechanism aims at eliciting toxic responses that paradoxically score high rewards, and (2) the generation-based mechanism utilizes optimizable prefixes to control the model output. By injecting 1\% of these specially crafted prompts into the data, through malicious users, we demonstrate a toxicity score up to two times higher when a specific trigger word is used. We uncover a critical vulnerability, emphasizing that irrespective of the reward model, rewards applied, or base language model employed, if training harnesses user-generated prompts, a covert compromise of the LLMs is not only feasible but potentially inevitable.

چکیده به فارسی (ترجمه ماشینی)

مدل های بزرگ زبان (LLM) توانایی های بزرگی را در درک و تولید زبان طبیعی نشان داده اند ، که عمدتاً به فرآیند تراز پیچیده با استفاده از بازخورد انسان نسبت داده شده است.در حالی که تراز به یک مؤلفه آموزش ضروری تبدیل شده است که داده های جمع آوری شده از نمایش داده های کاربر را به دست می آورد ، سهواً راهی را برای نوع جدیدی از حملات مسمومیت با هدایت کاربر باز می کند.در این مقاله ، ما یک اکتشاف جدید در مورد آسیب پذیری های نهفته خط لوله آموزش در LLM های اخیر ارائه می دهیم ، که نشان دهنده حمله مسمومیت ظریف و در عین حال مؤثر از طریق سوابق مربوط به کاربر برای نفوذ در حمایت از آموزش تراز است.حمله ما ، حتی بدون دانش صریح در مورد LLM های هدف در تنظیم جعبه سیاه ، به طور ظریف مکانیسم بازخورد پاداش را برای تخریب عملکرد مدل مرتبط با یک کلمه کلیدی خاص ، همه در حالی که همچنان ناخوشایند باقی مانده است ، تغییر می دهد.ما دو مکانیسم را برای ساخت وترهای بدخواهانه پیشنهاد می کنیم: (1) مکانیسم مبتنی بر انتخاب با هدف انتخاب پاسخ های سمی که به طور پارادوکسیک جوایز بالایی کسب می کنند ، و (2) مکانیسم مبتنی بر نسل از پیشوندهای بهینه سازی برای کنترل خروجی مدل استفاده می کند.با تزریق 1 \ ٪ از این موارد خاص ساخته شده به داده ها ، از طریق کاربران مخرب ، وقتی از یک کلمه ماشه خاص استفاده می شود ، نمره سمیت را تا دو برابر بیشتر نشان می دهیم.ما یک آسیب پذیری بحرانی را کشف می کنیم ، با تأکید بر این که صرف نظر از مدل پاداش ، پاداش های اعمال شده یا مدل زبان پایه به کار رفته ، در صورتی که آموزش به شما منجر شود ، یک سازش پنهانی از LLMS نه تنها امکان پذیر بلکه بالقوه اجتناب ناپذیر است.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.