ترجمه فارسی مقاله دفاع‌های LLM هنوز برای فرار از زندان انسان‌ها مقاوم نیستند

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
عنوان مقاله به فارسی دفاع‌های LLM هنوز برای فرار از زندان انسان‌ها مقاوم نیستند
نویسندگان Nathaniel Li, Ziwen Han, Ian Steneker, Willow Primack, Riley Goodside, Hugh Zhang, Zifan Wang, Cristina Menghini, Summer Yue
فرمت مقاله انگلیسی PDF
تعداد صفحات 36
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Computation and Language,Cryptography and Security,Computers and Society,یادگیری ماشین , محاسبات و زبان , رمزنگاری و امنیت , رایانه ها و جامعه ,
توضیحات Submitted 3 September, 2024; v1 submitted 27 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده در 3 سپتامبر 2024 ؛V1 ارسال شده 27 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Recent large language model (LLM) defenses have greatly improved models' ability to refuse harmful queries, even when adversarially attacked. However, LLM defenses are primarily evaluated against automated adversarial attacks in a single turn of conversation, an insufficient threat model for real-world malicious use. We demonstrate that multi-turn human jailbreaks uncover significant vulnerabilities, exceeding 70% attack success rate (ASR) on HarmBench against defenses that report single-digit ASRs with automated single-turn attacks. Human jailbreaks also reveal vulnerabilities in machine unlearning defenses, successfully recovering dual-use biosecurity knowledge from unlearned models. We compile these results into Multi-Turn Human Jailbreaks (MHJ), a dataset of 2,912 prompts across 537 multi-turn jailbreaks. We publicly release MHJ alongside a compendium of jailbreak tactics developed across dozens of commercial red teaming engagements, supporting research towards stronger LLM defenses.

چکیده به فارسی (ترجمه ماشینی)

مدافع مدلهای بزرگ زبان بزرگ (LLM) توانایی مدلها را در امتناع از سؤالات مضر ، حتی در صورت حمله مخالف ، بسیار بهبود بخشیده است.با این حال ، دفاع LLM در درجه اول در برابر حملات مخالف خودکار در یک نوبت مکالمه ، یک الگوی تهدید کافی برای استفاده مخرب در دنیای واقعی ارزیابی می شود.ما نشان می دهیم که زندانیان چند نوری انسانی از آسیب پذیری های قابل توجهی پرده برداری می کنند ، بیش از 70 ٪ میزان موفقیت حمله (ASR) در Harmbench در برابر دفاعی که ASR های تک رقمی را با حملات خودکار تک نوبت گزارش می دهند.فرار از زندان های انسانی همچنین آسیب پذیری ها را در دفاعی در حال آگاهی از دستگاه نشان می دهد ، و با موفقیت دانش زیست امنیتی دوگانه را از مدلهای غیرقابل کنترل بازیابی می کند.ما این نتایج را در زندان های چند نوری انسانی (MHJ) کامپایل می کنیم ، یک مجموعه داده از 2،912 در 537 فرار از زندان چند نوبت.ما MHJ را به طور عمومی در کنار مجموعه ای از تاکتیک های فرار از زندان که در ده ها نفر از مشاغل تیمی قرمز تجاری ایجاد شده است ، منتشر می کنیم و از تحقیقات در مورد دفاع قوی تر LLM حمایت می کنیم.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.