ترجمه فارسی مقاله فارسی بهینهسازی ترجیحات لنگر انداخته شده و اصلاحات مقابلهای: پرداختن به عدم تعیین دقیق در همترازی
| عنوان مقاله به انگلیسی | Anchored Preference Optimization and Contrastive Revisions: Addressing Underspecification in Alignment |
| عنوان مقاله به فارسی | فارسی بهینهسازی ترجیحات لنگر انداخته شده و اصلاحات مقابلهای: پرداختن به عدم تعیین دقیق در همترازی |
| نویسندگان | Karel D'Oosterlinck, Winnie Xu, Chris Develder, Thomas Demeester, Amanpreet Singh, Christopher Potts, Douwe Kiela, Shikib Mehri |
| فرمت مقاله انگلیسی | |
| تعداد صفحات | 18 |
| دسته بندی موضوعات | Machine Learning,Artificial Intelligence,Computation and Language,یادگیری ماشین , هوش مصنوعی , محاسبات و زبان , |
| توضیحات | Submitted 14 September, 2024; v1 submitted 12 August, 2024; originally announced August 2024. |
| توضیحات به فارسی | ارسال شده در 14 سپتامبر 2024 ؛V1 ارسال شده 12 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد. |
قیمت: 19,000 تومان
سفارش
با انتخاب این گزینه، علاوه بر دریافت مقاله اصلی، را نیز سفارش میدهید.
قیمت: 720,000 تومان
زمان تحویل: 2 تا 3 روز کاری
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
-
کتاب صدها نکته فارسی (خودمونی) – نسخه PDF — زبان ساده و کاربردی
مشاهده نمونه نسخه نکات ساده -
کتاب صدها نکته رسمی فارسی – نسخه PDF — نگارش استاندارد و علمی
مشاهده نمونه نسخه نکات رسمی -
کتاب صدها پرسش و پاسخ تشریحی – نسخه PDF
— هر سؤال همراه با پاسخ کامل برای درک عمیق مفاهیم
مشاهده نمونه نسخه پرسش و پاسخ -
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع -
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
- این محصول به صورت فایل دانلودی کامل ارائه میشود.
- توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
- دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
- برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
- اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی:
واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248
تلگرام: @ma_limbs
چکیده
Large Language Models (LLMs) are often aligned using contrastive alignment objectives and preference pair datasets. The interaction between model, paired data, and objective makes alignment a complicated procedure, sometimes producing subpar results. We study this and find that (i) preference data gives a better learning signal when the underlying responses are contrastive, and (ii) alignment objectives lead to better performance when they specify more control over the model during training. Based on these insights, we introduce Contrastive Learning from AI Revisions (CLAIR), a data-creation method which leads to more contrastive preference pairs, and Anchored Preference Optimization (APO), a controllable and more stable alignment objective. We align Llama-3-8B-Instruct using various comparable datasets and alignment objectives and measure MixEval-Hard scores, which correlate highly with human judgments. The CLAIR preferences lead to the strongest performance out of all datasets, and APO consistently outperforms less controllable objectives. Our best model, trained on 32K CLAIR preferences with APO, improves Llama-3-8B-Instruct by 7.65%, closing the gap with GPT4-turbo by 45%. Our code is available at https://github.com/ContextualAI/CLAIR_and_APO.
چکیده به فارسی (ترجمه ماشینی)
مدل های بزرگ زبان (LLMS) اغلب با استفاده از اهداف تراز متضاد و مجموعه داده های جفت اولویت تراز می شوند.تعامل بین مدل ، داده های زوج و هدف ، تراز را به یک روش پیچیده تبدیل می کند و گاهی اوقات نتایج Subpar را تولید می کند.ما این را مطالعه می کنیم و می دانیم که (i) داده های اولویت هنگامی که پاسخ های اساسی متضاد هستند ، سیگنال یادگیری بهتری می بخشد ، و (ب) اهداف تراز منجر به عملکرد بهتر می شوند وقتی که کنترل بیشتری بر مدل در طول آموزش نشان می دهند.بر اساس این بینش ها ، ما یادگیری متضاد از تجدید نظر در مورد AI (CLAIR) ، یک روش ایجاد داده را معرفی می کنیم که منجر به جفت ترجیح متضاد تر و بهینه سازی ترجیح لنگر (APO) می شود ، یک هدف تراز قابل کنترل و پایدار تر.ما با استفاده از مجموعه داده های مختلف قابل مقایسه و اهداف تراز ، Llama-3-8B را تراز می کنیم و نمرات مخلوط سخت را اندازه گیری می کنیم ، که بسیار با قضاوت های انسانی ارتباط دارد.ترجیحات CLAIR منجر به قوی ترین عملکرد از همه مجموعه داده ها می شود و APO به طور مداوم از اهداف قابل کنترل کمتری برخوردار است.بهترین مدل ما ، که بر روی ترجیحات 32K Clair با APO آموزش دیده است ، به صورت مجوز Llama-3-8B با 7.65 ٪ بهبود می یابد و این شکاف را با GPT4-توربو 45 ٪ بسته می کند.کد ما در https://github.com/contextualai/clair_and_apo در دسترس است.📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
-
کتاب صدها نکته فارسی (خودمونی) – نسخه PDF — زبان ساده و کاربردی
مشاهده نمونه نسخه نکات ساده -
کتاب صدها نکته رسمی فارسی – نسخه PDF — نگارش استاندارد و علمی
مشاهده نمونه نسخه نکات رسمی -
کتاب صدها پرسش و پاسخ تشریحی – نسخه PDF
— هر سؤال همراه با پاسخ کامل برای درک عمیق مفاهیم
مشاهده نمونه نسخه پرسش و پاسخ -
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع -
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
- این محصول به صورت فایل دانلودی کامل ارائه میشود.
- توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
- دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
- برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
- اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی:
واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248
تلگرام: @ma_limbs
نظرات
هنوز نظری ثبت نشده است.
وارد شوید تا نظر ثبت کنید.