ترجمه فارسی مقاله Mamba in the Llama: تقطیر و تسریع مدل های هیبریدی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی The Mamba in the Llama: Distilling and Accelerating Hybrid Models
عنوان مقاله به فارسی Mamba in the Llama: تقطیر و تسریع مدل های هیبریدی
نویسندگان Junxiong Wang, Daniele Paliotta, Avner May, Alexander M. Rush, Tri Dao
فرمت مقاله انگلیسی PDF
تعداد صفحات 17
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,یادگیری ماشین , هوش مصنوعی ,
توضیحات Submitted 27 August, 2024; originally announced August 2024. , Comments: Code is open-sourced at https://github.com/jxiw/MambaInLlama
توضیحات به فارسی ارسال شده در 27 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد. ، نظرات: کد در https://github.com/jxiw/mambainllama باز شده است
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Linear RNN architectures, like Mamba, can be competitive with Transformer models in language modeling while having advantageous deployment characteristics. Given the focus on training large-scale Transformer models, we consider the challenge of converting these pretrained models for deployment. We demonstrate that it is feasible to distill large Transformers into linear RNNs by reusing the linear projection weights from attention layers with academic GPU resources. The resulting hybrid model, which incorporates a quarter of the attention layers, achieves performance comparable to the original Transformer in chat benchmarks and outperforms open-source hybrid Mamba models trained from scratch with trillions of tokens in both chat benchmarks and general benchmarks. Moreover, we introduce a hardware-aware speculative decoding algorithm that accelerates the inference speed of Mamba and hybrid models. Overall we show how, with limited computation resources, we can remove many of the original attention layers and generate from the resulting model more efficiently. Our top-performing model, distilled from Llama3-8B-Instruct, achieves a 29.61 length-controlled win rate on AlpacaEval 2 against GPT-4 and 7.35 on MT-Bench, surpassing the best instruction-tuned linear RNN model.

چکیده به فارسی (ترجمه ماشینی)

معماری های خطی RNN ، مانند Mamba ، می تواند با مدل های ترانسفورماتور در مدل سازی زبان در حالی که دارای ویژگی های استقرار سودمند است ، رقابتی باشد.با توجه به تمرکز بر آموزش مدلهای ترانسفورماتور در مقیاس بزرگ ، ما چالش تبدیل این مدل های پیش ساخته برای استقرار را در نظر می گیریم.ما نشان می دهیم که با استفاده مجدد از وزن های پیش بینی خطی از لایه های توجه با منابع GPU دانشگاهی ، تقطیر ترانسفورماتورهای بزرگ به RNN های خطی امکان پذیر است.مدل ترکیبی حاصل ، که شامل یک چهارم از لایه های توجه است ، به عملکرد قابل مقایسه با ترانسفورماتور اصلی در معیارهای چت دست می یابد و مدل های Mamba Hybrid منبع باز را که از ابتدا با تریلیون های توکن در هر دو معیار چت و معیارهای عمومی آموزش دیده است ، از ابتدا آموزش می دهد.علاوه بر این ، ما یک الگوریتم رمزگشایی سوداگرانه آگاه از سخت افزار را معرفی می کنیم که سرعت استنتاج مدل های Mamba و Hybrid را تسریع می کند.به طور کلی ما نشان می دهیم که چگونه ، با منابع محاسباتی محدود ، می توانیم بسیاری از لایه های توجه اصلی را از بین ببریم و از مدل حاصل با کارآمدتر تولید کنیم.مدل عملکرد برتر ما ، که از Intruct LLAMA3-8B تقطیر شده است ، به یک نرخ پیروزی کنترل شده 29.61 در Alpacaeval 2 در برابر GPT-4 و 7.35 در MT-Bench می رسد و از بهترین مدل RNN خطی تنظیم شده تنظیم می شود.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.