ترجمه فارسی مقاله LinFusion: 1 GPU، 1 دقیقه، تصویر 16K

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی LinFusion: 1 GPU, 1 Minute, 16K Image
عنوان مقاله به فارسی LinFusion: 1 GPU، 1 دقیقه، تصویر 16K
نویسندگان Songhua Liu, Weihao Yu, Zhenxiong Tan, Xinchao Wang
فرمت مقاله انگلیسی PDF
تعداد صفحات 15
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computer Vision and Pattern Recognition,Machine Learning,چشم انداز رایانه و تشخیص الگوی , یادگیری ماشین ,
توضیحات Submitted 5 September, 2024; v1 submitted 3 September, 2024; originally announced September 2024. , Comments: Work in Progress. Codes are available at https://github.com/Huage001/LinFusion
توضیحات به فارسی ارسال شده در 5 سپتامبر 2024 ؛V1 ارسال شده در 3 سپتامبر 2024 ؛در ابتدا در سپتامبر 2024 اعلام شد ، نظرات: کار در حال انجام.کدها در https://github.com/huage001/linfusion در دسترس هستند
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Modern diffusion models, particularly those utilizing a Transformer-based UNet for denoising, rely heavily on self-attention operations to manage complex spatial relationships, thus achieving impressive generation performance. However, this existing paradigm faces significant challenges in generating high-resolution visual content due to its quadratic time and memory complexity with respect to the number of spatial tokens. To address this limitation, we aim at a novel linear attention mechanism as an alternative in this paper. Specifically, we begin our exploration from recently introduced models with linear complexity, e.g., Mamba2, RWKV6, Gated Linear Attention, etc, and identify two key features-attention normalization and non-causal inference-that enhance high-resolution visual generation performance. Building on these insights, we introduce a generalized linear attention paradigm, which serves as a low-rank approximation of a wide spectrum of popular linear token mixers. To save the training cost and better leverage pre-trained models, we initialize our models and distill the knowledge from pre-trained StableDiffusion (SD). We find that the distilled model, termed LinFusion, achieves performance on par with or superior to the original SD after only modest training, while significantly reducing time and memory complexity. Extensive experiments on SD-v1.5, SD-v2.1, and SD-XL demonstrate that LinFusion delivers satisfactory zero-shot cross-resolution generation performance, generating high-resolution images like 16K resolution. Moreover, it is highly compatible with pre-trained SD components, such as ControlNet and IP-Adapter, requiring no adaptation efforts. Codes are available at https://github.com/Huage001/LinFusion.

چکیده به فارسی (ترجمه ماشینی)

مدل های انتشار مدرن ، به ویژه آنهایی که از یک Unet مبتنی بر ترانسفورماتور برای دفع کردن استفاده می کنند ، برای مدیریت روابط پیچیده فضایی به شدت به عملیات خودآگاهی متکی هستند ، بنابراین به عملکرد چشمگیر نسل می رسند.با این حال ، این الگوی موجود به دلیل زمان درجه دوم و پیچیدگی حافظه با توجه به تعداد نشانه های مکانی ، در تولید محتوای بصری با وضوح بالا با چالش های قابل توجهی روبرو است.برای پرداختن به این محدودیت ، ما هدف ما از مکانیسم توجه خطی جدید به عنوان یک گزینه جایگزین در این مقاله هستیم.به طور خاص ، ما اکتشافات خود را از مدل های اخیراً معرفی شده با پیچیدگی خطی ، به عنوان مثال ، Mamba2 ، RWKV6 ، توجه خطی دروازه و غیره شروع می کنیم و دو ویژگی مهم و عادی سازی و استنباط غیرعادی را شناسایی می کنیم-این باعث می شود عملکرد تولید بصری با وضوح بالا را تقویت کنند.با تکیه بر این بینش ها ، ما یک الگوی توجه خطی تعمیم یافته را معرفی می کنیم ، که به عنوان یک تقریب کم از طیف گسترده ای از میکسرهای توکن خطی محبوب عمل می کند.برای صرفه جویی در هزینه آموزش و مدلهای بهتر از پیش آموزش اهرم ، ما مدل های خود را آغاز می کنیم و دانش را از قبل از آموزش از قبل آموزش داده شده (SD) تقطیر می کنیم.ما می دانیم که مدل مقطر ، به نام Linfusion ، عملکرد را با یا برتر از SD اصلی پس از تنها آموزش متوسط ​​، به دست می آورد ، در حالی که به طور قابل توجهی پیچیدگی زمان و حافظه را کاهش می دهد.آزمایش های گسترده ای در مورد SD-V1.5 ، SD-V2.1 و SD-XL نشان می دهد که Linfusion عملکرد تولید وضوح متقابل صفر را ارائه می دهد ، و تصاویر با وضوح بالا مانند وضوح 16K ایجاد می کند.علاوه بر این ، با اجزای SD از پیش آموزش دیده ، مانند ControlNet و IP-Adapter بسیار سازگار است و نیازی به تلاش برای سازگاری ندارد.کدها در https://github.com/huage001/linfusion در دسترس هستند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.