ترجمه فارسی مقاله پیشرفت یادگیری انتقال پسوند متخاصم در مدل های زبان بزرگ تراز شده

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Advancing Adversarial Suffix Transfer Learning on Aligned Large Language Models
عنوان مقاله به فارسی پیشرفت یادگیری انتقال پسوند متخاصم در مدل های زبان بزرگ تراز شده
نویسندگان Hongfu Liu, Yuxi Xie, Ye Wang, Michael Shieh
فرمت مقاله انگلیسی PDF
تعداد صفحات 11
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computation and Language,Cryptography and Security,Machine Learning,محاسبات و زبان , رمزنگاری و امنیت , یادگیری ماشین ,
توضیحات Submitted 27 August, 2024; originally announced August 2024. , Comments: 11 pages, 4 figures
توضیحات به فارسی ارسال شده در 27 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد ، نظرات: 11 صفحه ، 4 شکل
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Language Language Models (LLMs) face safety concerns due to potential misuse by malicious users. Recent red-teaming efforts have identified adversarial suffixes capable of jailbreaking LLMs using the gradient-based search algorithm Greedy Coordinate Gradient (GCG). However, GCG struggles with computational inefficiency, limiting further investigations regarding suffix transferability and scalability across models and data. In this work, we bridge the connection between search efficiency and suffix transferability. We propose a two-stage transfer learning framework, DeGCG, which decouples the search process into behavior-agnostic pre-searching and behavior-relevant post-searching. Specifically, we employ direct first target token optimization in pre-searching to facilitate the search process. We apply our approach to cross-model, cross-data, and self-transfer scenarios. Furthermore, we introduce an interleaved variant of our approach, i-DeGCG, which iteratively leverages self-transferability to accelerate the search process. Experiments on HarmBench demonstrate the efficiency of our approach across various models and domains. Notably, our i-DeGCG outperforms the baseline on Llama2-chat-7b with ASRs of $43.9$ ($+22.2$) and $39.0$ ($+19.5$) on valid and test sets, respectively. Further analysis on cross-model transfer indicates the pivotal role of first target token optimization in leveraging suffix transferability for efficient searching.

چکیده به فارسی (ترجمه ماشینی)

مدل های زبانی زبان (LLMS) به دلیل سوء استفاده احتمالی کاربران مخرب با نگرانی های ایمنی روبرو هستند.تلاش های تیمسازی قرمز اخیر پسوندهای مخالف را با استفاده از الگوریتم جستجوی مبتنی بر شیب گرادیان حریص (GCG) قادر به LLM های فرار از زندان است.با این حال ، GCG با ناکارآمدی محاسباتی مبارزه می کند ، و تحقیقات بیشتر در مورد انتقال پسوند و مقیاس پذیری در مدل ها و داده ها را محدود می کند.در این کار ، ما ارتباط بین راندمان جستجو و قابلیت انتقال پسوند را ایجاد می کنیم.ما یک چارچوب یادگیری انتقال دو مرحله ای ، DEGCG را پیشنهاد می کنیم ، که فرایند جستجو را به پیش زمینه رفتار-آگنوستیک و پس از جستجوی مربوط به رفتار تبدیل می کند.به طور خاص ، ما برای تسهیل روند جستجو بهینه سازی توکن اول مستقیم در پیش زمینه استفاده می کنیم.ما رویکرد خود را به سناریوهای متقاطع ، داده های متقابل و خود انتقال اعمال می کنیم.علاوه بر این ، ما یک نوع درهم آمیخته از رویکرد خود ، I-DEGG را معرفی می کنیم ، که به طور تکراری از خود انتقال پذیری برای تسریع در روند جستجو استفاده می کند.آزمایشات مربوط به Harmbench نشان دهنده کارآیی رویکرد ما در مدل ها و دامنه های مختلف است.نکته قابل توجه ، I-DEGG ما به ترتیب در LLAMA2-CHAT-7B با ASR 43.9 دلار (22.2 $) و 39.0 دلار ($+19.5 $) در مجموعه های معتبر و آزمون بهتر عمل می کند.تجزیه و تحلیل بیشتر در مورد انتقال متقاطع نشان دهنده نقش محوری بهینه سازی توکن هدف اول در افزایش قابلیت انتقال پسوند برای جستجوی کارآمد است.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.