ترجمه فارسی مقاله UI-JEPA: به سوی درک فعال از هدف کاربر از طریق فعالیت کاربر روی صفحه

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی UI-JEPA: Towards Active Perception of User Intent through Onscreen User Activity
عنوان مقاله به فارسی UI-JEPA: به سوی درک فعال از هدف کاربر از طریق فعالیت کاربر روی صفحه
نویسندگان Yicheng Fu, Raviteja Anantha, Prabal Vashisht, Jianpeng Cheng, Etai Littwin
فرمت مقاله انگلیسی PDF
تعداد صفحات 16
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Computation and Language,Artificial Intelligence,Human-Computer Interaction,Machine Learning,محاسبات و زبان , هوش مصنوعی , تعامل انسان و رایانه , یادگیری ماشین ,
توضیحات Submitted 13 September, 2024; v1 submitted 6 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده 13 سپتامبر 2024 ؛V1 ارسال شده در 6 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Generating user intent from a sequence of user interface (UI) actions is a core challenge in comprehensive UI understanding. Recent advancements in multimodal large language models (MLLMs) have led to substantial progress in this area, but their demands for extensive model parameters, computing power, and high latency makes them impractical for scenarios requiring lightweight, on-device solutions with low latency or heightened privacy. Additionally, the lack of high-quality datasets has hindered the development of such lightweight models. To address these challenges, we propose UI-JEPA, a novel framework that employs masking strategies to learn abstract UI embeddings from unlabeled data through self-supervised learning, combined with an LLM decoder fine-tuned for user intent prediction. We also introduce two new UI-grounded multimodal datasets, "Intent in the Wild" (IIW) and "Intent in the Tame" (IIT), designed for few-shot and zero-shot UI understanding tasks. IIW consists of 1.7K videos across 219 intent categories, while IIT contains 914 videos across 10 categories. We establish the first baselines for these datasets, showing that representations learned using a JEPA-style objective, combined with an LLM decoder, can achieve user intent predictions that match the performance of state-of-the-art large MLLMs, but with significantly reduced annotation and deployment resources. Measured by intent similarity scores, UI-JEPA outperforms GPT-4 Turbo and Claude 3.5 Sonnet by 10.0% and 7.2% respectively, averaged across two datasets. Notably, UI-JEPA accomplishes the performance with a 50.5x reduction in computational cost and a 6.6x improvement in latency in the IIW dataset. These results underscore the effectiveness of UI-JEPA, highlighting its potential for lightweight, high-performance UI understanding.

چکیده به فارسی (ترجمه ماشینی)

ایجاد هدف کاربر از دنباله ای از اقدامات رابط کاربری (UI) یک چالش اساسی در درک جامع UI است.پیشرفت های اخیر در مدل های بزرگ زبان چند حالته (MLLMS) منجر به پیشرفت قابل توجهی در این زمینه شده است ، اما خواسته های آنها برای پارامترهای مدل گسترده ، قدرت محاسبات و تأخیر زیاد باعث می شود که آنها برای سناریوهایی که نیاز به راه حل های سبک وزن دارند ، با تأخیر کم یا افزایش یافته ، غیر عملی باشد.حریم خصوصیعلاوه بر این ، فقدان مجموعه داده های با کیفیت بالا مانع از توسعه چنین مدل های سبک وزن شده است.برای پرداختن به این چالش ها ، ما UI-JEPA را پیشنهاد می کنیم ، یک چارچوب جدید که از استراتژی های ماسک برای یادگیری تعبیه های انتزاعی UI از داده های بدون برچسب از طریق یادگیری خودبوشی استفاده می کند ، همراه با یک رمزگذار LLM که برای پیش بینی قصد کاربر تنظیم شده است.ما همچنین دو مجموعه داده چند منظوره جدید UI با نام "قصد در وحشی" (IIW) و "هدف در رنگ آمیزی" (IIT) را معرفی می کنیم ، که برای کارهای درک UI چند عکس و صفر طراحی شده است.IIW از فیلم های 1.7K در 219 دسته هدف تشکیل شده است ، در حالی که IIT حاوی 914 فیلم در 10 دسته است.ما اولین خط مقدماتی را برای این مجموعه داده ها ایجاد می کنیم ، نشان می دهد که بازنمایی ها با استفاده از یک هدف به سبک JEPA ، همراه با یک رمزگذار LLM ، می توانند به پیش بینی های قصد کاربر دست یابند که مطابق با عملکرد MLLM های بزرگ و پیشرفته باشد ، اما با قابل توجهی کاهش یافته است.منابع حاشیه نویسی و استقرار.اندازه گیری شده توسط نمرات شباهت هدف ، UI-JEPA به ترتیب از GPT-4 Turbo و Claude 3.5 Sonnet به ترتیب 10.0 ٪ و 7.2 ٪ بهتر است ، به طور متوسط ​​در دو مجموعه داده.نکته قابل توجه ، UI-JEPA با کاهش 50.5 برابر هزینه محاسباتی و بهبود 6.6 برابر در تأخیر در مجموعه داده IIW ، عملکرد را انجام می دهد.این نتایج تأکید می کند که اثربخشی UI-JEPA را نشان می دهد و پتانسیل آن را برای درک سبک وزن و با کارایی بالا نشان می دهد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.