Cryptography and Security,Artificial Intelligence,Computation and Language,Machine Learning,رمزنگاری و امنیت , هوش مصنوعی , محاسبات و زبان , یادگیری ماشین ,
توضیحات
Submitted 31 August, 2024; originally announced September 2024. , Comments: 13 pages
توضیحات به فارسی
ارسال 31 اوت 2024 ؛در ابتدا سپتامبر 2024 اعلام شد ، نظرات: 13 صفحه
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs
چکیده
With the growing deployment of LLMs in daily applications like chatbots and content generation, efforts to ensure outputs align with human values and avoid harmful content have intensified. However, increasingly sophisticated jailbreak attacks threaten this alignment, aiming to induce unsafe outputs. Current defense efforts either focus on prompt rewriting or detection, which are limited in effectiveness due to the various design of jailbreak prompts, or on output control and detection, which are computationally expensive as they require LLM inference. Therefore, designing a pre-inference defense method that resists diverse jailbreak prompts is crucial for preventing LLM jailbreak attacks. We observe that jailbreak attacks, safe queries, and harmful queries exhibit different clustering patterns within the LLM's hidden state representation space. This suggests that by leveraging the LLM's hidden state representational capabilities, we can analyze the LLM's forthcoming behavior and proactively intervene for defense. In this paper, we propose a jailbreak attack defense strategy based on a Hidden State Filter (HSF), a lossless architectural defense mechanism that enables the model to preemptively identify and reject adversarial inputs before the inference process begins. We activate its defensive potential through an additional plugin module, effectively framing the defense task as a classification problem. Experimental results on two benchmark datasets, utilizing three different LLMs, show that HSF significantly enhances resilience against six cutting-edge jailbreak attacks. It significantly reduces the success rate of jailbreak attacks while minimally impacting responses to benign user queries, with negligible inference overhead, and outperforming defense baselines.Our code and data are available at https://anonymous.4open.science/r/Hidden-State-Filtering-8652/
چکیده به فارسی (ترجمه ماشینی)
با استقرار فزاینده LLMS در برنامه های روزانه مانند چت بابات و تولید محتوا ، تلاش برای اطمینان از خروجی ها با ارزش های انسانی و جلوگیری از محتوای مضر ، تشدید شده است.با این حال ، حملات به طور فزاینده ای پیچیده فرار از زندان ، این تراز را تهدید می کند ، با هدف القاء خروجی های ناامن.تلاش های دفاعی فعلی یا بر بازنویسی سریع یا تشخیص ، که به دلیل طراحی مختلف اعطای فرار از زندان ، یا در کنترل خروجی و تشخیص ، که از نظر محاسباتی گران هستند ، که از نظر محاسباتی گران هستند ، تمرکز دارند.بنابراین ، طراحی یک روش دفاعی از پیش استنتاج که در برابر اعلان های مختلف فرار از زندان مقاومت می کند ، برای جلوگیری از حملات فرار از زندان LLM بسیار مهم است.ما مشاهده می کنیم که حملات فرار از زندان ، نمایش داده شدگان ایمن و نمایش داده شدگان مضر ، الگوهای مختلف خوشه بندی را در فضای نمایندگی پنهان LLM به نمایش می گذارند.این نشان می دهد که با استفاده از قابلیت های نمایندگی حالت پنهان LLM ، می توانیم رفتار آینده LLM را تجزیه و تحلیل کنیم و از نظر فعال برای دفاع مداخله کنیم.در این مقاله ، ما یک استراتژی دفاعی حمله به فرار از زندان را بر اساس یک فیلتر حالت پنهان (HSF) ، یک مکانیسم دفاعی معماری بدون ضرر پیشنهاد می کنیم که مدل را قادر می سازد تا قبل از شروع فرآیند استنتاج ، ورودی های مخالف را شناسایی و رد کند.ما پتانسیل دفاعی آن را از طریق یک ماژول افزونه اضافی فعال می کنیم ، و به طور موثری وظیفه دفاع را به عنوان یک مشکل طبقه بندی قاب می کنیم.نتایج تجربی در دو مجموعه داده معیار ، با استفاده از سه LLM مختلف ، نشان می دهد که HSF به طور قابل توجهی مقاومت در برابر شش حمله فرار از زندان را افزایش می دهد.این میزان موفقیت حملات فرار از زندان را به میزان قابل توجهی کاهش می دهد در حالی که حداقل پاسخهای تأثیرگذار به پرس و جوهای خوش خیم کاربر ، با سربار استنباط ناچیز ، و از خطوط دفاعی بهتر عمل می کند.-Filtering-8652/
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs