ترجمه فارسی مقاله HSF: دفاع در برابر حملات فرار از زندان با فیلتر حالت مخفی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی HSF: Defending against Jailbreak Attacks with Hidden State Filtering
عنوان مقاله به فارسی HSF: دفاع در برابر حملات فرار از زندان با فیلتر حالت مخفی
نویسندگان Cheng Qian, Hainan Zhang, Lei Sha, Zhiming Zheng
فرمت مقاله انگلیسی PDF
تعداد صفحات 13
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Cryptography and Security,Artificial Intelligence,Computation and Language,Machine Learning,رمزنگاری و امنیت , هوش مصنوعی , محاسبات و زبان , یادگیری ماشین ,
توضیحات Submitted 31 August, 2024; originally announced September 2024. , Comments: 13 pages
توضیحات به فارسی ارسال 31 اوت 2024 ؛در ابتدا سپتامبر 2024 اعلام شد ، نظرات: 13 صفحه
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

With the growing deployment of LLMs in daily applications like chatbots and content generation, efforts to ensure outputs align with human values and avoid harmful content have intensified. However, increasingly sophisticated jailbreak attacks threaten this alignment, aiming to induce unsafe outputs. Current defense efforts either focus on prompt rewriting or detection, which are limited in effectiveness due to the various design of jailbreak prompts, or on output control and detection, which are computationally expensive as they require LLM inference. Therefore, designing a pre-inference defense method that resists diverse jailbreak prompts is crucial for preventing LLM jailbreak attacks. We observe that jailbreak attacks, safe queries, and harmful queries exhibit different clustering patterns within the LLM's hidden state representation space. This suggests that by leveraging the LLM's hidden state representational capabilities, we can analyze the LLM's forthcoming behavior and proactively intervene for defense. In this paper, we propose a jailbreak attack defense strategy based on a Hidden State Filter (HSF), a lossless architectural defense mechanism that enables the model to preemptively identify and reject adversarial inputs before the inference process begins. We activate its defensive potential through an additional plugin module, effectively framing the defense task as a classification problem. Experimental results on two benchmark datasets, utilizing three different LLMs, show that HSF significantly enhances resilience against six cutting-edge jailbreak attacks. It significantly reduces the success rate of jailbreak attacks while minimally impacting responses to benign user queries, with negligible inference overhead, and outperforming defense baselines.Our code and data are available at https://anonymous.4open.science/r/Hidden-State-Filtering-8652/

چکیده به فارسی (ترجمه ماشینی)

با استقرار فزاینده LLMS در برنامه های روزانه مانند چت بابات و تولید محتوا ، تلاش برای اطمینان از خروجی ها با ارزش های انسانی و جلوگیری از محتوای مضر ، تشدید شده است.با این حال ، حملات به طور فزاینده ای پیچیده فرار از زندان ، این تراز را تهدید می کند ، با هدف القاء خروجی های ناامن.تلاش های دفاعی فعلی یا بر بازنویسی سریع یا تشخیص ، که به دلیل طراحی مختلف اعطای فرار از زندان ، یا در کنترل خروجی و تشخیص ، که از نظر محاسباتی گران هستند ، که از نظر محاسباتی گران هستند ، تمرکز دارند.بنابراین ، طراحی یک روش دفاعی از پیش استنتاج که در برابر اعلان های مختلف فرار از زندان مقاومت می کند ، برای جلوگیری از حملات فرار از زندان LLM بسیار مهم است.ما مشاهده می کنیم که حملات فرار از زندان ، نمایش داده شدگان ایمن و نمایش داده شدگان مضر ، الگوهای مختلف خوشه بندی را در فضای نمایندگی پنهان LLM به نمایش می گذارند.این نشان می دهد که با استفاده از قابلیت های نمایندگی حالت پنهان LLM ، می توانیم رفتار آینده LLM را تجزیه و تحلیل کنیم و از نظر فعال برای دفاع مداخله کنیم.در این مقاله ، ما یک استراتژی دفاعی حمله به فرار از زندان را بر اساس یک فیلتر حالت پنهان (HSF) ، یک مکانیسم دفاعی معماری بدون ضرر پیشنهاد می کنیم که مدل را قادر می سازد تا قبل از شروع فرآیند استنتاج ، ورودی های مخالف را شناسایی و رد کند.ما پتانسیل دفاعی آن را از طریق یک ماژول افزونه اضافی فعال می کنیم ، و به طور موثری وظیفه دفاع را به عنوان یک مشکل طبقه بندی قاب می کنیم.نتایج تجربی در دو مجموعه داده معیار ، با استفاده از سه LLM مختلف ، نشان می دهد که HSF به طور قابل توجهی مقاومت در برابر شش حمله فرار از زندان را افزایش می دهد.این میزان موفقیت حملات فرار از زندان را به میزان قابل توجهی کاهش می دهد در حالی که حداقل پاسخهای تأثیرگذار به پرس و جوهای خوش خیم کاربر ، با سربار استنباط ناچیز ، و از خطوط دفاعی بهتر عمل می کند.-Filtering-8652/

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.